통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
능선 회귀가 올가미처럼 일부 계수를 0으로 축소하지 않는 이유는 무엇입니까?
LASSO 회귀를 설명 할 때 다이아몬드와 원의 다이어그램이 종종 사용됩니다. LASSO의 구속 조건의 모양이 다이아몬드이기 때문에, 가장 작은 제곱 솔루션은 다이아몬드의 모서리에 닿아 일부 변수가 축소 될 수 있다고합니다. 그러나 능선 회귀에서는 원이기 때문에 종종 축에 닿지 않습니다. 축을 건드릴 수 없거나 LASSO보다 특정 매개 변수를 축소 할 가능성이 낮은 …

1
다중 선형 회귀 분석에서 예측 된 점의 플롯이 직선에 있지 않은 이유는 무엇입니까?
Y와 X1, X2 사이의 관계를 설명하기 위해 다중 선형 회귀를 사용하고 있습니다. 이론으로부터 나는 다중 회귀가 Y와 X 각각 (Y와 X1, Y와 X2) 사이의 선형 관계를 가정한다는 것을 이해했습니다. X 변환을 사용하지 않습니다. 따라서 R = 0.45 및 모든 중요 X (P <0.05)의 모델을 얻었습니다. 그런 다음 X1에 대해 Y를 …

3
2 단계 모델 : Heckman 모델 (샘플 선택 처리)과 기기 변수 (내인성 처리)의 차이점
나는 샘플 선택과 내 생성의 차이에 대해 고심하려고 노력하고 있으며, 결과적으로 Heckman 모델 (샘플 선택을 처리하기 위해)이 내 생성을 처리하기 위해 도구 변수 회귀와 어떻게 다른지에 대해 노력하고 있습니다. 내생 변수가 치료 될 가능성이있는 경우, 시료 선택이 특정 형태의 내인성이라고 말하는 것이 맞습니까? 또한 Heckman 모델과 IV 회귀 모두 2 …

5
최신 연구를 어떻게 최신 상태로 유지합니까?
arXiv에 관한이 질문을 읽고 이전에 알지 못했던 GitXiv에 대한 링크를 찾은 후 사람들이 해당 지역의 최신 연구에 대한 최신 정보를 유지하기 위해 어떤 웹 사이트 / 리소스를 사용하는지 궁금했습니다.
16 academia 


4
P- 값을 잘못 이해하고 있습니까?
그래서 P- 값을 올바르게 해석하는 방법에 대해 많은 것을 읽었으며, 읽은 내용에서 p- 값은 귀무 가설이 참인지 거짓인지에 대해 NOTHING이라고 말합니다. 그러나 다음 문장을 읽을 때 p – 값은 제 1 종 오류를 만들거나 귀무 가설이 참일 경우이를 기각 할 확률을 나타냅니다. p 값이 작을수록 귀무 가설을 잘못 기각 할 …

2
주성분 분석을 수행하기 전에 데이터를 로그 변환하는 이유는 무엇입니까?
PCA에 대한 이해를 높이려면 http://www.r-bloggers.com/computing-and-visualizing-pca-in-r/ 튜토리얼을 따르십시오 . 학습서는 Iris 데이터 세트를 사용하고 PCA 이전에 로그 변환을 적용합니다. [1] 세트에 의해 제안 공지 다음 코드에서는 연속 변수 로그 변환을 적용하는 것이 center와 scale동일 TRUE하도록 호출 prcomp전에 PCA를 적용하여 변수의 표준화. 누군가 Iris 데이터 세트의 처음 네 열에서 로그 함수를 먼저 …

2
관절 분포가 다변량 정규 인 경우 왜 Pearson의 ρ가 완전한 연관성 측정치입니까?
이 주장은 이 질문 에 대한 최고의 응답으로 제기되었습니다 . 나는 '왜'질문이 새로운 스레드를 보장하기에 충분히 다르다고 생각합니다. 인터넷 검색의 "완전한 연관성 측정"으로 인한 조회수는 없었으며 해당 문구가 무엇을 의미하는지 잘 모르겠습니다.

3
부트 스트랩이 필요한 이유는 무엇입니까?
저는 현재 Larry Wasserman의 "All of Statistics"를 읽고 있으며 비모수 적 모델의 통계 함수 추정에 관한 장에서 쓴 내용에 의문을 가지고 있습니다. 그가 썼다 "때로는 일부 계산을 수행하여 통계 함수의 추정 표준 오차를 찾을 수 있습니다. 그러나 다른 경우에는 표준 오차를 추정하는 방법이 명확하지 않습니다". 다음 장에서 그는이 문제를 해결하기 …

3
ETS () 함수, 과거 데이터와 일치하지 않는 예측을 피하는 방법?
월간 예측 계산을 자동화하기 위해 R의 알고리즘을 작성 중입니다. 특히 예측 패키지를 계산하기 위해 예측 패키지의 ets () 함수를 사용하고 있습니다. 잘 작동하고 있습니다. 불행히도, 특정 시계열의 경우 내가 얻는 결과가 이상합니다. 사용중인 코드 아래를 찾으십시오. train_ts<- ts(values, frequency=12) fit2<-ets(train_ts, model="ZZZ", damped=TRUE, alpha=NULL, beta=NULL, gamma=NULL, phi=NULL, additive.only=FALSE, lambda=TRUE, lower=c(0.0001,0.0001,0.0001,0.8),upper=c(0.9999,0.9999,0.9999,0.98), opt.crit=c("lik","amse","mse","sigma","mae"), …

3
신경망에서의 탠 대 시그 모이 드
나는 여전히 이것에 속도를 내고 있다는 사실에 대해 사과드립니다. 내 신경 활성화 기능에 tanh (map -1 to 1) 대 sigmoid (map 0-1)를 사용하는 장단점을 이해하려고합니다. 내 독서에서 그것은 약간의 차이가있는 사소한 것 같았습니다. 실제로 내 문제에 대해 나는 시그 모이 드가 훈련하기 쉽고 이상하다는 것을 알았습니다. 시그 모이 드는 일반적인 …

1
다변량 가우스 데이터의 PCA 구성 요소가 통계적으로 독립적입니까?
데이터가 다변량 정규 분포 인 경우 PCA 구성 요소 (주요 구성 요소 분석)가 통계적으로 독립적입니까? 그렇다면 어떻게 이것을 증명 / 증명할 수 있습니까? 이 게시물을 보았으므로 질문에 답변합니다. PCA는 명시 적 가우스 성 가정을하지 않습니다. 데이터에 설명 된 분산을 최대화하는 고유 벡터를 찾습니다. 주성분의 직교성은 가능한 가장 많은 데이터 변동을 …
16 pca  independence  svd 


2
표준 편차에 대한 폐쇄 형 비 편향 추정기가 어떤 분포에 대해 있습니까?
정규 분포의 경우 다음과 같이 표준 편차에 대한 편견 추정기가 있습니다. σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2−−−−−−−−−−−−√σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2\hat{\sigma}_\text{unbiased} = \frac{\Gamma(\frac{n-1}{2})}{\Gamma(\frac{n}{2})} \sqrt{\frac{1}{2}\sum_{k=1}^n(x_i-\bar{x})^2} 이 결과가 잘 알려지지 않은 이유는 그것이 수입이 큰 문제가 아니라 주로 큐리오이기 때문인 것으로 보인다 . 이 스레드에서 증명이 이루어 집니다 . 정규 분포의 주요 특성을 활용합니다. 1σ2∑k=1n(xi−x¯)2∼χ2n−11σ2∑k=1n(xi−x¯)2∼χn−12 \frac{1}{\sigma^2} \sum_{k=1}^n(x_i-\bar{x})^2 \sim \chi^{2}_{n-1} 거기에서 약간의 …

2
왜 '무작위'신뢰 또는 신뢰할만한 간격을 사용합니까?
나는 최근에 자신감과 믿을만한 간격으로 무작위성을 포함하는 논문을 읽고 있었고 이것이 표준인지 (그리고 그렇다면 합당한 일인지) 궁금했습니다. 표기법을 설정하려면 데이터가 x∈Xx∈Xx \in X 이고 매개 변수 구간을 만드는 데 관심 이 있다고 가정하십시오 θ∈Θθ∈Θ\theta \in \Theta. 함수를 작성하여 구성되는 신뢰 / 신뢰성 간격에 익숙합니다. fx:Θ→{0,1}fx:Θ→{0,1}f_{x} : \Theta \rightarrow \{0,1\} 구간을 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.