통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
Pearson의 상관 검정에 대한 p- 값을 상관 계수 및 표본 크기만으로 계산할 수 있습니까?
배경 : 저자가 표본 크기 878에서 Pearson 상관 관계 0.754를보고하는 기사를 읽었습니다 . 상관 관계 테스트의 결과 p- 값은 "두 별"로 유의합니다 (예 : p <0.01). 그러나 표본 크기가 크면 해당 p- 값이 0.001보다 작아야합니다 (즉, 별 3 개 중요). 이 테스트에 대한 p- 값을 Pearson 상관 계수 및 샘플 …


2
효과 크기가 아닌 설명 통계는 무엇입니까?
위키 백과 는 말합니다 효과 크기는 현상의 강도 또는 해당 수량의 샘플 기반 추정치입니다. 데이터에서 계산 된 효과 크기는 데이터의 겉보기 관계가 모집단의 실제 관계를 반영하는지 여부에 대한 진술없이 관계의 추정 된 크기를 전달하는 설명 통계량입니다. 그것을 더 잘 이해하기 위해 그래프와 플롯을 제외하고 설명 통계가 효과 크기가 아닌 것이 …

2
데이터에 가우시안 분포가있는 경우 몇 개의 샘플을 특성화합니까?
단일 차원으로 분포 된 가우시안 데이터는이를 특성화하기 위해 두 개의 매개 변수가 필요하며 (평균, 분산), 약 30 개의 무작위로 선택된 샘플이 일반적으로 이러한 매개 변수를 합리적으로 높은 신뢰도로 추정하기에 충분하다는 소문이 있습니다. 그러나 차원 수가 증가하면 어떻게됩니까? 2 차원 (예 : 높이, 무게)에서 "최적의"타원을 지정하려면 5 개의 매개 변수가 필요합니다. …

1
기계 학습을 사용하여 재무 시계열을 예측하는 첫 단계 학습
기계 학습을 사용하여 미래의 재무 시계열 1 단계 이상을 예측하는 방법을 파악하려고합니다. 설명 데이터가 포함 된 재무 시계열이 있으며 모델을 구성한 다음 모델을 사용하여 n 단계를 미리 예측하고 싶습니다. 내가 지금까지 한 일은 : getSymbols("GOOG") GOOG$sma <- SMA(Cl(GOOG)) GOOG$range <- GOOG$GOOG.High-GOOG$GOOG.Low tail(GOOG) GOOG.Open GOOG.High GOOG.Low GOOG.Close GOOG.Volume GOOG.Adjusted sma range …


2
Gelman이보고 한“역설”의 이름
Andrew Gelman의 저서 "Red State, Blue State"에서 그는 특정 주 내의 부유 한 사람들이 빈민보다 더 많은 공화당에 투표하는 경향이 있지만 부유 한 주에서는 가난한 국가보다 더 많은 민주당에 투표하는 경향이 있다는 사실을 분석합니다 . 이 역설의 이름이 있습니까? 생태 역설과 관련이 있지만 동일하지는 않은 것 같습니다.
12 paradox 

2
R에서 lmer ()를 사용하여 Poisson GLMM에서과 분산을 테스트하는 방법은 무엇입니까?
다음과 같은 모델이 있습니다. > model1<-lmer(aph.remain~sMFS1+sAG1+sSHDI1+sbare+season+crop +(1|landscape),family=poisson) ... 이것은 요약 출력입니다. > summary(model1) Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS1 + sAG1 + sSHDI1 + sbare + season + crop + (1 | landscape) AIC BIC logLik deviance 4057 4088 -2019 4039 Random effects: …


3
Naive Bayes에는 확률이 있습니다. 단어를 두 번 세어야합니까?
내 Naive Bayes bag o 'words 모델을 프로토 타이핑하고 있으며, 기능 확률 계산에 대한 질문이있었습니다. 두 가지 클래스가 있다고 가정 해 봅시다. 모든 사람들이 사용하는 스팸이기 때문에 스팸과 스팸 아님을 사용합니다. 그리고 "viagra"라는 단어를 예로 들어 봅시다. 트레이닝 세트에 10 개의 이메일, 5 개의 스팸 및 5 개의 비 스팸이 …

5
회귀 및 분류를 모두 수행하는 R의 기능 선택 패키지
잠김 . 이 질문과 주제는 주제가 다르지만 역사적으로 중요하기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. 저는 R을 처음 사용합니다. 지금 기계 학습을 배우고 있습니다. 이 질문이 매우 기본적인 것으로 보이는 경우 매우 죄송합니다. R에서 좋은 기능 선택 패키지를 찾으려고합니다. Boruta 패키지를 살펴 보았습니다. 좋은 패키지이지만 …

5
숫자 20이 마법인가요?
데이터 피팅 분포에 대해 최소 20의 표본 크기를 고려하도록 권고 한 참고 자료가 있습니다. 이것에 어떤 의미가 있습니까? 감사


3
Mundlak 고정 효과 절차는 인형과 함께 로지스틱 회귀에 적용 할 수 있습니까?
8000 개의 클러스터와 4 백만 개의 관측치가있는 데이터 세트가 있습니다. 불행히도 내 통계 소프트웨어 Stata는 로지스틱 회귀 분석에 패널 데이터 기능을 사용할 때 다소 느리게 실행됩니다 xtlogit. 그러나 비 패널 logit기능을 사용하면 결과가 훨씬 빨리 나타납니다. 따라서 logit고정 효과를 설명하는 수정 된 데이터를 사용하면 이점을 얻을 수 있습니다 . 나는이 …

2
QQ 플롯이 히스토그램과 일치하지 않습니다
히스토그램, 커널 밀도 및 재정 로그 수익률의 정규 분포가 손실로 바뀌고 (표지가 변경됨) 이러한 데이터의 일반적인 QQ 플롯이 있습니다. QQ 플롯은 꼬리가 올바르게 장착되지 않았 음을 명확하게 보여줍니다. 그러나 히스토그램과 적합 정규 분포 (파란색)를 보면 0.0 정도의 값도 올바르게 피팅되지 않습니다. 따라서 QQ 플롯은 꼬리 만 제대로 적합하지 않지만 전체 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.