통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


3
모형 선택 : 로지스틱 회귀
공변량 및 이진 결과 변수 가 있다고 가정 합니다. 이러한 공변량 중 일부는 여러 수준으로 범주 형입니다. 다른 것들은 연속적입니다. "최상의"모델을 어떻게 선택 하시겠습니까? 즉, 모형에 포함 할 공변량을 어떻게 선택합니까?x 1 , … , x n y엔nn엑스1, … , x엔x1,…,xnx_1, \dots, x_n와이yy 간단한 로지스틱 회귀 분석을 사용하여 각 공변량으로 …

2
데이터 축소에 대한 반복 측정에서 PCA를 수행 할 수 있습니까?
나는 두 가지 상황에서 각각 87 마리의 동물에 대해 3 번의 실험을했습니다 (일부 누락 된 데이터; 누락 된 데이터 없음 = 64 마리의 동물). 내가 (그들에게 전화하는 상황에서 행동을 설명하는 2 ~ 3 복합 행동 점수를 개발하려는 있도록 맥락에서, 나는 많은 특정 조치를 (입력 시간, 쉼터로 돌아 횟수 등)이 C1, …

2
로지스틱 회귀 모델 평가
이 질문은 물류 모델이 충분한 지 결정하는 방법에 대한 실제 혼란에서 비롯됩니다. 종속 변수로 형성된 후 2 년 후에 개별 프로젝트 쌍의 상태를 사용하는 모델이 있습니다. 결과는 성공적이거나 (1) 그렇지 않습니다 (0). 쌍 형성시 측정 된 독립 변수가 있습니다. 내 목표는 내가 가정 한 변수가 쌍의 성공에 영향을 미치는지 여부를 …

1
시계열 교차 유효성 검사로 예측 오류 계산
시계열에 대한 예측 모델이 있으며 샘플 외부 예측 오류를 계산하려고합니다. 현재 내가 따르고있는 전략은 Rob Hyndman의 블로그 (페이지 하단 근처)에서 제안 된 것입니다 (시계열 및 크기 의 훈련 세트를 가정 )y1,…,yny1,…,yny_1,\dots,y_nkkk 데이터에 모델을 장착 및하자 다음 관찰에 대한 예측합니다.yt,…,yt+k−1yt,…,yt+k−1y_t,\dots,y_{t+k-1}y^t+ky^t+k\hat{y}_{t+k} 예측 오류를 .et=y^t+k−yt+ket=y^t+k−yt+ke_{t} = \hat{y}_{t+k} - y_{t+k} 대해 반복t=1,…,n−kt=1,…,n−kt=1,\dots,n-k 평균 제곱 …

2
순서 형 로지스틱 회귀 모형이 제공되는 반응 범주를 어떻게 예측합니까?
건강 문제를 예측하고 싶습니다. '정상', '가벼운'및 '심각한'의 3 가지 결과 범주가 있습니다. 나는이 문제 (예 또는 아니오)와 함께 두 개의 예측 변수, 테스트 결과 (연속, 간격 공변량) 및 가족 이력으로부터 이것을 예측하고 싶습니다. 필자의 샘플에서 확률은 55 % (정상), 35 % (가벼움) 및 10 % (심각)입니다. 이런 의미에서, 나는 항상 …

1
스피어 맨 상관 계수의 차이에 대한 유의성 검정
(빠른 답변을 많이 주셔서 감사합니다! 질문을 잘 못해서 다시 시도하겠습니다.) 두 Spearman의 상관 관계의 차이가 통계적으로 유의한지 여부를 확인하는 방법을 모르겠습니다. 그것을 찾는 방법을 알고 싶습니다. 내가 알고 싶었던 이유는 Gabrilovich와 Markovitch의 위키 백과 기반의 자연 언어 처리 의미 론적 해석 ( Journal of Artificial Intelligence Research 34 (2009) 443-498) …

3
선험적으로 말하면 샘플 크기를 동적으로 늘리는 것이 괜찮습니까?
주제 내 설계를 사용하여 한 자극의 장점에 대한 연구를하려고합니다. 연구의 일부 부분 (작업 유형 순서, 자극 순서, 작업 세트 순서)의 순서 효과를 줄이기 위해 설계된 순열 체계가 있습니다. 순열 체계는 표본 크기를 8로 나눌 수 있음을 나타냅니다. 표본 크기를 결정하기 위해서는 난폭 한 추측 (나의 분야에서 좋은 전통)을 취하거나 원하는 …


2
경제학자들은 암시장 운영을 어떻게 정량화합니까?
저는 저의 저자에게 유리한 프로젝트로 동아시아에서 조직 범죄에 대해 많은 연구를하고 있었으며, 전 세계 암시장 운영의 가치를 평가하는 경제학자와 언론인이 주목되었습니다. . 이에 대한 방법론은 무엇입니까? 이 숫자들은 어떻게 모입니까? 이 수치는 전통적인 시장 모델에서 포착 되었습니까?

1
RMSE에서 가능성 계산
몇 가지 매개 변수를 사용하여 궤적 (시간의 함수로 x)을 예측하는 모델이 있습니다. 현재 예측 궤도와 실험적으로 기록 된 궤도 사이의 RMSE (root mean square error)를 계산합니다. 현재 나는 simplex (matlab의 fminsearch)를 사용 하여이 차이 (RMSE)를 최소화합니다. 이 방법이 적합하게 작동하는 동안 여러 모델을 비교하고 싶습니다. 따라서 RMSE를 최소화하는 대신 최대한 …

2
다중 레벨 모델링이없는 경우 연구가 복제 단위 인 메타 분석에서 연구 내 복제를 처리하는 방법은 무엇입니까?
연구 설명 : 연구 내 복제 처리와 관련하여 메타 분석에서 일반적인 오류가 관찰되었습니다. 가정이 언급 될 때 오류가 연구를 무효화하는지 여부는 명확하지 않습니다. 그러나 내가 이해하는 것처럼 이러한 가정은 기본 통계 전제를 위반합니다. 예를 들어, 한 연구에서 화학 물질 가 반응 에 미치는 영향을 테스트합니다 .Y엑스XX와이YY 분석은 로그 응답 비율에 …

2
표본 최대 값의 분산은 얼마입니까?
랜덤 변수의 최대 값의 분산에 대한 경계를 찾고 있습니다. 즉, 대한 닫힌 형식 수식을 찾고 있는데 , \ mbox {Var} (\ max_i X_i) \ leq B \ enspace, 여기서 X = \ {X_1, \ ldots, X_M \} 은 고정입니다 유한 한 M 랜덤 변수 세트는 \ mu_1, \ ldots, \ …



당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.