통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
Ronald Fisher의 주요 통계적 기여는 무엇입니까?
Richard Dawkins는 Ronald Fisher 가 Fisher의 Wikipedia 약력 에서 인용 한 "현대 통계 및 실험 설계의 아버지"라고 설명했습니다 . 또한 Anders Hald 는 자신의 저서 " 수학 통계의 역사 "에서 그를 "현대 통계 과학의 기초를 거의 한 손으로 만든 천재" 라고 불렀습니다 . 사람들이 그에게 그렇게 높은 평가를하도록 정확히 무엇을했는지 …

1
랜덤 포레스트 평가 : OOB 대 CV
예를 들어 AUC를 사용하여 랜덤 포레스트의 품질을 평가할 때 백 아웃 샘플 또는 홀드 아웃 교차 검증 세트를 통해 이러한 수량을 계산하는 것이 더 적절합니까? OOB 샘플을 통해 계산하면 더 비관적 인 평가를 제공하지만 그 이유는 알 수 없습니다.

2
생존 분석에서 검열에 대한 Layman의 설명
나는 검열이 무엇인지와 생존 분석에서 어떻게 계산되어야하는지에 대해 읽었지만 그에 대한 수학적 정의가 적고 더 직관적 인 정의를 듣고 싶습니다 (사진은 좋을 것입니다!). 누구든지 1) 검열과 2) Kaplan-Meier 곡선 및 Cox 회귀와 같은 영향에 대한 설명을 제공 할 수 있습니까?

1
바이어스-분산 분해
주교의 패턴 인식 및 기계 학습의 3.2 절 에서, 제곱 손실 함수에 대해 예상 손실이 제곱 바이어스 항으로 분해 될 수 있음을 나타내는 바이어스-분산 분해에 대해 설명합니다 (평균 예측이 실제로부터 얼마나 멀리 떨어져 있는지 설명 함). 모델), 분산 항 (평균 주변 예측의 확산을 설명) 및 잡음 항 (데이터의 고유 잡음을 …


4
작은 샘플 그래프
작업을 완료하기 위해 14 개의 개별 시간으로 구성된 작은 데이터 세트가 있습니다. 그러나 데이터를 그래프로 표시하는 데 사용할 적절한 그래프를 찾는 데 어려움이 있습니다. 샘플이 더 큰 경우 상자 그림이나 히스토그램을 사용하지만 샘플이 너무 작은 경우이 경우에 사용하는 것이 적합한 지 확실하지 않습니다. 업데이트 : 시간은 5.2,3.9,5.6,4.2,3.8,4.1,6.0,5.6,4.4,4.5,4.9,4.5,4.9,4.2입니다.


1
분산 분석은 최대 가능성이 아닌 순간의 방법에 의존합니까?
ANOVA는 모멘트 방법을 사용하여 추정을 수행한다고 여러 곳에서 언급했습니다. 비록 순간의 방법에 익숙하지는 않지만, 그것이 최대 가능성의 방법과는 다르고 그와 동등한 것이 아니라는 것을 이해하기 때문에 나는 그 주장에 혼란을 느낀다. 반면, ANOVA는 범주 형 예측 변수를 사용하는 선형 회귀로 볼 수 있으며 회귀 모수에 대한 OLS 추정 은 최대 …

1
여러 조건을 가진 베이 즈 정리
이 방정식이 어떻게 도출되었는지 이해할 수 없습니다. P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} 이 방정식은 OJ Simpson의 사례가 문제로 제시된 논문 "확률에 의한 시험"에서 발췌 한 것입니다. 피고는 이중 살인 혐의로 재판을 받고 있으며 그에 대한 두 가지 증거가 도입되었습니다. M1M1M_{1} 은 피고의 피가 범죄 현장에서 발견 된 한 방울의 피와 …

1
Daniel Wilks (2011)는 왜 주요 구성 요소 회귀 분석이 "편향 될 것"이라고 말합니까?
에서 대기 과학 통계 방법 예측 인자 중 매우 강한 intercorrelations (제 3 판, 페이지 559-560)이있는 경우, 다니엘 윌크스 노트는 다중 선형 회귀 분석 문제가 발생할 수 : 다중 선형 회귀 분석에서 발생할 수있는 병리학은 강력한 상호 상관 관계가있는 예측 변수 세트가 불안정한 회귀 관계 계산을 초래할 수 있다는 것입니다. …
13 regression  pca  bias 

2
예측이 통계량의 능력을 판단하는 '골든 기준'입니까?
지난 주말에 R (1st edition)로 Faraway의 교과서 선형 모델을 읽었습니다 . Faraway에는 "통계 전략 및 모델 불확실성"이라는 장이있었습니다. 그는 매우 복잡한 모델을 사용하여 인위적으로 일부 데이터를 생성했다고 설명하고 (158 페이지), 학생들에게 데이터를 모델링하고 학생들의 예측 결과 와 읽은 결과를 비교하도록 요청했습니다 . 불행히도 대부분의 학생들은 테스트 데이터를 과도하게 맞추고 예측 …


1
승률은 간단했다
나는 확률을 이해하는 데 어려움을 겪고 있으며, 그것들을 해석하는 방법에 대한 기본적인 설명을 원합니다. 확률과 관련된 다양한 게시물을 찾았지만 대부분 이해하려는 것보다 복잡합니다. 다음은 확률을 해석하는 방법의 예입니다. 이벤트가 발생할 확률이 3 대 1이면 이벤트가 발생하지 않는 1 회마다 3 번 발생합니다. 이 해석이 올바른지 모르겠습니다. 따라서 확률을 해석하는 데 …

1
'고유'가 행렬 반전에 어떻게 도움이되는지 설명
내 질문은 geoR:::.negloglik.GRF또는 에서 악용 된 계산 기술과 관련이 geoR:::solve.geoR있습니다. 선형 혼합 모델 설정에서 : 여기서 와 는 각각 고정 및 랜덤 효과입니다. 또한β b Σ = cov ( Y )와이= Xβ+ Zb + eY=Xβ+Zb+e Y=X\beta+Zb+e ββ\beta비bbΣ = 코브 ( Y)Σ=cov(Y)\Sigma=\text{cov}(Y) 효과를 추정 할 때, 계산에 필요가있다 일반적으로 같은 것을 …

5
무한 롤 시리즈에서 선택한 다이의 평균값
주사위 한 쌍을 무한히 굴려서 항상 두 값 중 더 높은 값을 선택하면 가장 높은 값의 예상 평균이 3.5를 초과합니까? 백만 개의 주사위를 굴리고 매번 가장 높은 값을 선택하면 각 롤에 6 개를 사용할 수 있다는 가능성이 압도적입니다. 따라서 예상 평균은 5.999999999999와 같아야합니다. 그러나 나는 단지 2 주사위를 사용하여 예를 …
13 dice 

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.