통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

5
왜 ?
나는 그것을 생각 P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B) = P(A | B,C) * P(C) + P(A|B,\neg C) * P(\neg C) 정확하지만 P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B) = P(A | B,C) + P(A|B,\neg C) 부정확하다. 그러나 나는 나중에 대해 "직관"을 얻었습니다. 즉, 두 경우 (C 또는 C가 아닌)를 분할하여 확률 P (A | B)를 고려합니다. 이 직관이 왜 틀린가?

2
혼합 모형에서의 모수 추정에 대한 직감 (분산 모수 대 조건부 모드)
나는 무작위 효과 (피험자에 대한 BLUP / 조건 모드)가 선형 혼합 효과 모델의 매개 변수가 아니라 추정 분산 / 공분산 매개 변수에서 파생 될 수 있다는 것을 여러 번 읽었습니다. 예를 들어 Reinhold Kliegl et al. (2011) 상태 : 무작위 효과는 대 평균 RT에서 피사체의 편차와 고정 효과 매개 변수에서 …

3
변수를 제어하는 ​​것이 부적절한 경우는 언제입니까?
적어도 하나의 순진한 예를 생각할 수 있습니다. X와 Z의 관계를 연구하고 싶다고 가정 해 봅시다. 또한 Y가 Z에 영향을 미치기 때문에 Y를 제어한다고 생각합니다. 그러나 나에게 알려지지 않은 것처럼, X는 Y를, Y는 Z를 유발합니다. Y의 경우, X는 Y가 주어진 Z와 무관하기 때문에 X와 Z의 관계를 "표지"합니다. 이전의 예에서, 제가 공부해야 …

3
단순 카이 제곱 테스트 대신 glm () 사용
glm()R을 사용하여 귀무 가설을 변경하는 데 관심 이 있습니다. 예를 들면 다음과 같습니다. x = rbinom(100, 1, .7) summary(glm(x ~ 1, family = "binomial")) 가설을 검정합니다 . 내에서 null을 p = 임의의 값 으로 변경하려면 어떻게해야 합니까? p=0.5p=0.5p = 0.5pppglm() 이 작업을 prop.test()and 로도 수행 할 수 있다는 것을 알고 …

3
작은 유효성 검사 세트를 사용할 수 있습니까?
데이터를 테스트 세트와 검증 세트로 나누는 이유를 이해합니다. 또한 분할 규모는 상황에 따라 다르지만 일반적으로 50/50에서 90/10까지 다양합니다. 철자를 수정하고 ~ 5m 문장의 데이터 세트로 시작하기 위해 RNN을 만들었습니다. 나는 500k 문장을 깎고 나머지 ~ 4.5m 문장으로 훈련합니다. 훈련이 끝나면 검증 세트를 가져와 정확도를 계산합니다. 흥미로운 점은 유효성 검사 세트의 …

5
합산 분산은 "실제로"무엇을 의미합니까?
나는 통계의 멍청한 놈이므로 너희들이 나를 도와 줄 수 있니? 내 질문은 다음과 같습니다. 풀 분산은 실제로 무엇을 의미합니까? 인터넷에서 풀링 된 분산에 대한 공식을 찾을 때 다음 공식을 사용하여 많은 문헌을 찾습니다 (예 : http://math.tntech.edu/ISR/Mathematical_Statistics/Introduction_to_Statistical_Tests/thispage/newnode19.html ) : S2p=S21(n1−1)+S22(n2−1)n1+n2−2Sp2=S12(n1−1)+S22(n2−1)n1+n2−2\begin{equation} \label{eq:stupidpooledvar} \displaystyle S^2_p = \frac{S_1^2 (n_1-1) + S_2^2 (n_2-1)}{n_1 + n_2 …
15 variance  mean  pooling 


2
로지스틱 회귀 분석은 어떻게 전통적인 함수가 아닌 곡선을 만들 수 있습니까?
로지스틱 회귀 분석의 기능이 어떻게 작동하는지에 대한 근본적인 혼란이 있다고 생각합니다. 함수 h (x)가 이미지 왼쪽에 보이는 곡선을 어떻게 생성합니까? 이것이 두 변수의 플롯이지만이 두 변수 (x1 & x2)도 함수 자체의 인수입니다. 하나의 변수에 대한 표준 함수가 하나의 출력에 매핑되는 것을 알고 있지만이 함수는 분명히 그렇게하지 않습니다. 왜 그런지 확실하지 …

1
다중 대치 후 풀링 교정 플롯
다중 대치 후 교정 플롯 / 통계 풀링에 대한 조언을 원합니다. 미래 사건을 예측하기 위해 통계 모델을 개발하는 설정에서 (예를 들어, 병원 기록의 데이터를 사용하여 퇴원 후 생존 또는 사건을 예측하는 경우), 누락 된 정보가 많이 있다고 상상할 수 있습니다. 다중 대치는 이러한 상황을 처리하는 방법이지만 고유 한 대치 불확실성으로 …

2
혼합 모델에 기대 극대화가 중요한 이유는 무엇입니까?
혼합 모델 (가우스 혼합, 은닉 마르코프 모델 등)에 대한 기대 최대화 방법을 강조하는 문헌이 많이 있습니다. EM이 중요한 이유 EM은 최적화를 수행하는 방법 일 뿐이며 그라디언트 기반 방법 (그라데이션 디센트 또는 뉴턴 / 쿼이 뉴턴 방법) 또는 여기에서 논의 된 기타 그라디언트 프리 방법으로 널리 사용되지는 않습니다 . 또한 EM은 …

5
회귀 모형을 개선하기 위해 평균 절대 오차의 상자 그림을 기반으로 특이 치를 제거하는 것이 부정입니까?
아래 상자 그림에서 볼 수 있듯이 네 가지 방법으로 테스트 한 예측 모델이 있습니다. 모델이 예측하는 속성의 범위는 0-8입니다. 당신은이 있음을 알 수 있습니다 하나의 상한선 이상치 와 세 하한 이상치 모든 방법으로 지적했다. 데이터에서 이러한 인스턴스를 제거하는 것이 적절한 지 궁금합니다. 아니면 예측 모델을 개선하기 위해 일종의 부정 행위입니까?



2
높은 손실 값에도 불구하고 우수한 정확도
간단한 신경망 이진 분류기를 훈련하는 동안 교차 엔트로피를 사용하여 높은 손실 값을 얻습니다. 그럼에도 불구하고 검증 세트에 대한 정확성의 가치는 상당히 우수합니다. 의미가 있습니까? 손실과 정확도 사이에 엄격한 상관 관계가 없습니까? 나는 0.4011-acc : 0.8224-val_loss : 0.4577-val_acc : 0.7826 값을 훈련하고 검증 했습니다 . 이것은 NN을 구현하려는 첫 번째 시도이며 …

1
일반 PCA와 확률 적 PCA의 차이점은 무엇입니까?
정기적 인 PCA가 관측 된 데이터에 대한 확률 모델을 따르지 않는다는 것을 알고 있습니다. PCA와 PPCA 의 기본적인 차이점은 무엇 입니까? PPCA 잠복 변수 모델에는 예를 들어 관측 변수 , 잠복 (관찰되지 않은 변수 ) 및 정규 PCA에서와 같이 직교하지 않아도 되는 행렬 가 포함됩니다. 정규 PCA에 대해 생각할 수있는 …
15 pca 

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.