통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
회귀 잔차 분포 가정
오류에 대한 분포 가정을 배치해야하는 이유, 즉 yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , .ϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) 왜 쓰지 않습니까 yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , ,yi∼N(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) 어느 경우 든 입니다. 나는 분포 가정이 데이터가 아니라 설명이 아닌 오류에 관한 것이라고 강조했다 . ϵi=yi−y^ϵi=yi−y^\epsilon_i = y_i - \hat{y} 나는이 …

1
로지스틱 회귀 분석을위한 모자 매트릭스 정보
모자 매트릭스의 대각선에있는 값이 선형 회귀에 대해 제공하는 정보는 여러 사이트에서 명확하게 설명되어 있습니다. 로지스틱 회귀 모델의 모자 행렬은 명확하지 않습니다. 선형 회귀를 적용하는 모자 행렬에서 얻은 정보와 동일합니까? 이것은 CV의 다른 주제에서 찾은 모자 매트릭스의 정의입니다 (소스 1). H=VX(X′VX)−1X′VH=VX(X′VX)−1X′VH=VX ( X'V X)^-1 X' V X의 경우 예측 변수의 벡터이고 …

1
종속 변수에 "컷오프"가있는 경우 모델링
내가 사용하는 용어가 틀린 경우 사전에 사과하십시오. 정정을 환영합니다. "잘라 내기"라고 부르는 내용이 다른 이름으로 바뀌면 알려 주시면 질문을 업데이트 할 수 있습니다. 내가 관심있는 상황은 이것입니다. 독립 변수 xx\bf{x} 와 단일 종속 변수 yyy 있습니다. 모호하게 남겨 두 겠지만, 이러한 변수에 대해 좋은 회귀 모델을 얻는 것이 비교적 간단하다고 …

3
베이지안 대 MLE, 과적 합 문제
주교의 PRML 서적에서, 초과 적합은 MLE (Maximum Likelihood Estimation)의 문제이며 Bayesian은이를 피할 수 있다고 말합니다. 그러나 과적 합은 모수 추정에 사용 된 방법이 아니라 모형 선택에 대한 문제라고 생각합니다. 즉, 통해 생성되는 데이터 세트 가 있다고 가정 하면 이제 데이터에 맞게 다른 모델 를 선택 하고 알아낼 수 있습니다. 어느 …

2
독립 검정에서 카이 제곱 분포를 사용하는 이유는 무엇입니까?
적합도 테스트는 다음 사용 통계 : 것을 허가 테스트에서, 조건이 하나의 사용, 충족 - 분배 지정된 것을 P 값 계산하기 동일한 크기의 대표적인 샘플에서 이러한 값을 관찰하는 것이 사실 일 것이다.χ2χ2\chi^2 χ2χ20= ∑나는 = 1엔( O나는− E나는)2이자형나는χ02=∑i=1n(Oi−Ei)2Ei \chi_0^2=\sum_{i=1}^n\frac{(O_i-E_i)^2}{E_i} χ2χ2\chi^2H0H0H_0 그러나 통계량 가 ( 자유도를 갖는) 를 따르 려면 독립 표준 …

1
가우시안 선형 모델에서 F- 검정이 가장 강력한 이유는 무엇입니까?
가우시안 선형 모델 어떤 벡터 공간에 놓여로 가정 와 의 표준 정규 분포 ,의 통계 용 -test 여기서 는 벡터 공간이며, 이탈 통계량 의 일대일 함수 증가입니다 . 이 통계가 H_0에 가장 강력한 검정을 제공한다는 것을 어떻게 알 수 있습니까?Y=μ+σGY=μ+σGY=\mu+\sigma Gμμ\muWWWGGGRnRn\mathbb{R}^nFFFH0:{μ∈U}H0:{μ∈U}H_0\colon\{\mu \in U\}U⊂WU⊂WU \subset Wf=ϕ(2logsupμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=ϕ(2log⁡supμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=\phi\left( 2\log \frac{\sup_{\mu \in W, \sigma>0} …


2
은 VS -test
방금 존경받는 (인기있는) 과학 잡지 (독일 PM, 02/2013, p.36)에서 흥미로운 실험에 대해 읽었습니다 (불행히도 소스가 없음). 직관적으로 결과의 중요성을 의심했기 때문에 주목을 받았지만 제공된 정보는 통계 테스트를 재현하기에 충분했습니다. 연구원들은 추운 날씨에 추워지면 감기에 걸릴 확률이 높아지는 지 궁금했습니다. 그래서 그들은 무작위로 180 명의 학생 그룹을 두 그룹으로 나눕니다. 한 …

5
재귀 (온라인) 정규화 된 최소 제곱 알고리즘
누구든지 Tikhonov 정규화 (정규 최소 제곱)에 대한 온라인 (재귀) 알고리즘의 방향을 알려 줄 수 있습니까? 오프라인 설정에서 n-fold cross validation을 사용하여 λ 를 찾은 원래 데이터 세트를 사용하여 β^=(XTX+λI)−1XTYβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TY 를 계산 합니다. y = x ^ T \ hat \ beta를 사용하여 주어진 x에 대해 새로운 y 값을 예측할 수 …


1
확률과 PDF의 비율
클러스터링 문제를 해결하기 위해 Bayes를 사용하고 있습니다. 몇 가지 계산을 한 후 두 확률의 비율을 구해야합니다. P(A)/P(B)P(A)/P(B)P(A)/P(B) 를 얻을 수 있습니다 . 이 확률은 이 답변 에서 설명한 것처럼 두 개의 다른 2D 다변량 KDE를 통합하여 얻습니다 .P(H|D)P(H|D)P(H|D) P ( B ) = ∬ X , Y : g ( …

3
이항의 피셔 정보가
이항 분포가 비례하는 분산을 가지고 있다는 것을 혼동 / 불쾌하게합니다 . 마찬가지로 Fisher 정보는 1에 비례합니다.p ( 1 − p )p(1−p)p(1-p) . 그 이유는 무엇입니까? 피셔 정보가p=0.5로최소화되는 이유는 무엇입니까? 즉,p=0.5에서 추론이 가장 어려운 이유는무엇입니까?1p ( 1 − p )1p(1−p)\frac{1}{p(1-p)}p = 0.5p=0.5p=0.5p = 0.5p=0.5p=0.5 문맥: 저는 표본 크기 계산기를 만들고 있는데, …

2
MLE은 항상 데이터의 기본 PDF를 알고 있다는 의미입니까, EM은 그렇지 않다는 의미입니까?
MLE (Maximum Likelihood Estimation) 및 EM (Expectation Maximization)과 어떤 관련이 있는지에 대한 간단한 개념적 질문이 있습니다. 내가 이해하는 것처럼 누군가 "우리는 MLE를 사용했습니다"라고 말하면 데이터 PDF의 명시 적 모델을 가지고 있다는 의미입니까? 이것에 대한 대답은 그렇습니다. 다른 말로하면, 누군가 "MLE"이라고 말하면 어떤 PDF를 사용하는지 물어 보는 것이 좋습니다. 이것이 맞습니까? …

10
특정 통계적 의미가있는 일반적인 단어
나는 통계학자는 아니지만 연구 작업에는 통계 (데이터 분석, 문학 읽기 등)가 포함됩니다. 나는 여기 에 게시 된 내 질문 중 하나에 대한 의견에서 통계 분야에서 잘 연습 한 사람들에게 특히 특별한 의미 또는 의미가있는 몇 가지 일반적인 단어가 있음을 상기 시켰습니다 . 그러한 단어의 목록을 갖는 것이 도움이 될 것이며 …

2
t- 분포 밀도 함수의 직관
학생의 t- 분포에 대해 공부하고 있는데 t- 분포 밀도 함수를 어떻게 도출 할 수 있을지 궁금해지기 시작했습니다 (wikipedia, http://en.wikipedia.org/wiki/Student%27s_t-distribution ). f(t)=Γ(v+12)vπ−−√Γ(v2)(1+t2v)−v+12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} 여기서 는 자유도이고 는 감마 함수입니다. 이 기능의 직관은 무엇입니까? 이항 분포의 확률 질량 함수를 보면 나에게 의미가 있습니다. 그러나 t- 분포 밀도 함수는 전혀 이해가되지 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.