통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
Cox PH 모델에서 생존 시간 측면에서 예측을 얻는 방법은 무엇입니까?
추적 조사가 끝날 때 (예 : 1 년) 사망 한 참가자의 데이터 집합에서 모든 원인으로 인한 사망률에 대한 예측 모델 (Cox PH)을 개발하려고합니다. 특정 시점에서 사망의 절대 위험을 예측하는 대신 각 개인의 생존 시간 (개월)을 예측하고 싶습니다. R에서 그러한 예측을 얻을 수 있습니까 (예 : coxph-object에서), 그렇다면 어떻게 할 수 …

3
각 잎에 선형 회귀 모델이있는 회귀 트리 알고리즘
짧은 버전 : 의사 결정 트리를 작성할 수있는 R 패키지를 찾고 있지만 의사 결정 트리의 각 리프는 완전한 선형 회귀 모델입니다. AFAIK, 라이브러리 rpart는 종속 변수가 각 리프에서 일정한 의사 결정 트리를 만듭니다. rpart그러한 나무를 만들 수 있는 다른 라이브러리 (또는 내가 모르는 설정)가 있습니까? 긴 버전 : 훈련 데이터 …
14 r  regression  rpart  cart 

1
순서 변수와 연속 변수 사이의 상관 관계를 올바르게 평가하는 방법은 무엇입니까?
다음 사이의 상관 관계를 추정하고 싶습니다. 서수 변수 : 피험자들은 6 가지 종류의 과일에 대한 선호도를 1-5 척도로 평가해야합니다. 연속 변수 : 동일한 대상에게 이러한 과일을 신속하게 식별하도록 요청하여 6 개의 과일에 대한 평균 정확도를 얻습니다. Spearman rho가 이러한 데이터를 분석하는 가장 좋은 방법입니까? 아니면 고려할 수있는 다른 좋은 방법이 …

3
Cronbach의 알파 값에 대한 설명자는 어디에서 왔습니까 (예 : 불량, 우수)?
Cronbach의 알파 값을 다음과 같이 설명하는 것이 일반적입니다. α ≥ 0.9 우수 0.7 ≤ α <0.9 양호 0.6 ≤ α <0.7 허용 가능 0.5 ≤ α <0.6 나쁨 α <0.5 허용되지 않음 이 가치는 어디에서 오는가? 이것들을 설명하는 원본 연구 기사를 찾을 수 없습니다. 편집 : 나는 단지 컨벤션을 기반으로 …

2
작은
나는 4 가지 다른 시점 (치료 전, 치료 하루, 치료 후 4 주, 치료 후 2-4 개월)에서 철 수준에 대한 치료 효과를 조사한 연구에 대한 데이터를 받았다. 컨트롤 그룹이 없습니다. 그들은 치료 전 3 개의 시점에서 치료 전 (기준) 수준까지 철 수준의 유의 한 증가가 있는지 확인하려고합니다. 11 명의 환자는 …

1
회귀 모델에 종속 변수의 지연을 포함해야하는 시점과 지연은 언제입니까?
종속 변수로 사용하려는 데이터는 다음과 같습니다 (카운트 데이터). 순환 구성 요소와 추세 구조를 가지기 때문에 회귀 분석이 어떻게 든 편향되는 것으로 보입니다. 도움이되는 경우 음 이항 회귀를 사용합니다. 데이터는 균형 잡힌 패널로, 개인 (상태) 당 하나의 더미입니다. 표시된 이미지는 모든 상태에 대한 종속 변수의 합계를 표시하지만 대부분의 상태 만 유사한 …

2
범위와 표준 편차의 관계
기사에서 표본 크기 의 표준 편차에 대한 공식을 찾았습니다.NNN σ=R¯¯¯¯2.534σ=R¯2.534\sigma=\frac{\overline{R}}{2.534} 여기서 은 기본 샘플 의 하위 샘플 (크기 ) 의 평균 범위입니다 . 숫자 는 어떻게 계산됩니까? 이것은 정확한 숫자입니까?R¯¯¯¯R¯\overline{R}6662.5342.5342.534

1
Scipy의 베타 배포 피팅
Wikipedia에 따르면 베타 확률 분포에는 두 가지 모양 매개 변수 와 β가 있습니다.αα\alphaββ\beta [ 0 , 1 ] 범위의 숫자가있는 scipy.stats.beta.fit(x)Python을 호출하면 4 개의 값이 반환됩니다. 이것은 나를 이상하게 생각합니다.x[0,1][0,1][0,1] 인터넷 검색 후 호출하면 세 번째 변수가 0이므로 반환 값 중 하나가 'location'이어야한다는 것을 알았습니다 scipy.stats.beta.fit(x, floc=0). 누구든지 네 번째 …

2
그라디언트 디센트를 사용하여 k- 평균이 최적화되지 않는 이유는 무엇입니까?
k- 평균 이 일반적으로 Expectation Maximization을 사용하여 최적화 된다는 것을 알고 있습니다. 그러나 다른 최적화 방법과 동일하게 손실 기능을 최적화 할 수 있습니다! 실제로 대규모 k- 평균에 확률 론적 경사 하강 을 사용하는 일부 논문을 찾았 지만 질문에 대한 답변을 얻을 수 없었습니다. 왜 그런지 아는 사람이 있습니까? 기대 극대화가 …

2
숫자 데이터를 자연스럽게 형성되는 "브래킷"으로 그룹화하려면 어떻게해야합니까? (예 : 소득)
다음은 내가 달성하려는 것을 설명하지만 다른 문제 진술이 내 목표를 설명 할 수 있습니다. 하고 싶다 각 그룹 내 숫자의 분산이 너무 크지 않고 그룹 평균 간의 차이가 너무 작지 않은 그룹으로 다음 숫자를 나눕니다. 마지막에 얻은 분포를 "완벽한"분포와 비교하고 그것이 "완벽한"것과 얼마나 다른지보십시오. 레이맨의 목표 설명 소득 분포를 계산 …

1
지수 평활 모델에서 누락 된 데이터 처리
지수 평활 모형의 맥락에서 누락 된 데이터를 처리하는 표준 방법은없는 것 같습니다. 특히, 예측 패키지 에서 ets 라고하는 R 구현은 데이터 손실없이 가장 긴 하위 시퀀스를 취하는 것으로 보이며 Hyndman et al. 누락 된 데이터에 대해 전혀 이야기하지 않는 것 같습니다. 사용자가 명시 적으로 요청하면 (그리고 누락 된 데이터가 너무 …

1
R의 비선형 혼합 효과 회귀
놀랍게도 Google을 사용하여 다음 질문에 대한 답변을 찾을 수 없었습니다. 나는 시간에 대략 시그 모이 드 성장 행동을 보여주는 여러 개인의 생물학적 데이터를 가지고 있습니다. 따라서 표준 물류 성장을 사용하여 모델링하고 싶습니다. P(t) = k*p0*exp(r*t) / (k+p0*(exp(r*t)-1)) p = 0은 t = 0에서의 시작 값이고, k는 t-> 무한에서의 점근 한 …

4
신뢰할 수 없거나 혼란 스럽거나 잘못된 연구 또는 모델이 잘못 사용 된 공중 보건 정책 연구의 사례 연구는 무엇입니까?
데이터가 혼동되는 현재 공중 보건 문제에 대한 문헌 검토를 작성 중입니다. 공중 보건 정책 및 법률에서 무효 또는 혼란스러운 관계 또는 추론이 의도적으로 또는 잘못 사용 된 공중 보건 / 역학 교육에 사용되는 일반적인 역사적 사례 연구는 무엇입니까? 1960 년대 자동차 사망자 급증과 법에 의해 안전 벨트와 결국 에어백이 필요하다는 …

4
MCMC의 실제 예
나는 MCMC와 관련된 강의를하고있었습니다. 그러나 나는 그것이 어떻게 사용되는지에 대한 좋은 예를 찾지 못했습니다. 누구든지 구체적인 예를 들어 줄 수 있습니까? 내가 볼 수있는 것은 Markov 체인을 실행하고 고정 분포가 원하는 분포라고 말합니다. 원하는 분포를 샘플링하기 어려운 좋은 예를 원합니다. Markov 체인을 만듭니다. Markov 체인의 고정 분포가 대상 분포가되도록 전이 …

1
평균 편향 추정기가 평균 절대 편차를 최소화합니까?
이것은 후속 조치이지만 이전 질문과 다른 질문입니다 . 나는 Wikipedia에서 " 중간 편향 추정기가 Laplace가 관찰 한 절대 편차 손실 함수와 관련한 위험을 최소화 한다"고 읽었습니다 . 그러나 내 Monte Carlo 시뮬레이션 결과는이 주장을 지원하지 않습니다. 나는 로그 정규 모집단 에서 나온 샘플을 가정합니다 . . . , X N …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.