통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


3
앙상블 시계열 모델
시계열 예측을 자동화해야하며 해당 계열의 기능 (계절, 추세, 노이즈 등)을 미리 알지 못합니다. 내 목표는 각 시리즈에 가장 적합한 모델을 얻는 것이 아니라 매우 나쁜 모델을 피하는 것입니다. 다시 말해, 매번 작은 오류를 얻는 것은 문제가되지 않지만 가끔 큰 오류를 얻는 것은 문제가됩니다. 다른 기법으로 계산 된 모델을 결합하여이를 달성 …

3
베이지안 분석의 가능성과 조건부 분포
우리는 베이 즈 정리를 다음과 같이 쓸 수 있습니다. p(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(\theta|x) = \frac{f(X|\theta)p(\theta)}{\int_{\theta} f(X|\theta)p(\theta)d\theta} 여기서 는 사후, 는 조건부 분포, 는 이전입니다.p(θ|x)p(θ|x)p(\theta|x)f(X|θ)f(X|θ)f(X|\theta)p(θ)p(θ)p(\theta) 또는 p(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(\theta|x) = \frac{L(\theta|x)p(\theta)}{\int_{\theta} L(\theta|x)p(\theta)d\theta} 여기서 는 사후, 는 우도 함수이고 는 이전 함수 입니다.p(θ|x)p(θ|x)p(\theta|x)L(θ|x)L(θ|x)L(\theta|x)p(θ)p(θ)p(\theta) 내 질문은 조건부 분포가 아닌 우도 함수를 사용하여 베이지안 분석을 수행하는 이유는 무엇입니까? 가능성과 …

3
그룹 비교를위한 상호 작용 항과 별도의 회귀 분석을 사용한 공동 모형
이전 질문과 토론에서 귀중한 피드백을 수집 한 후 다음과 같은 질문을 제기했습니다. 예를 들어 남성과 여성의 두 그룹에서 효과 차이를 감지하는 것이 목표라고 가정합니다. 이를 수행하는 두 가지 방법이 있습니다. 두 그룹에 대해 두 개의 개별 회귀 분석을 실행하고 Wald 검정을 사용하여 귀무 가설 : 을 기각 (또는 거부)합니다 . …

1
R을 사용하여 임계 t 값을 어떻게 계산할 수 있습니까?
이것이 새로운 질문이라면 죄송합니다. 통계를 처음으로 가르치려고합니다. 기본 절차가 중단되었다고 생각하지만 R로 실행하는 데 어려움을 겪고 있습니다. 그래서 저는 선형 선형 회귀 형태의 회귀 계수의 중요성을 평가하려고합니다. 와이^= Xβ^와이^=엑스β^ \hat y = X \hat \beta 테스트를위한 t- 통계량 은 다음과 같이 주어집니다.H0: β^제이= 0 , Hㅏ: β^제이≠ 0H0:β^제이=0,Hㅏ:β^제이≠0H_0: \hat \beta_j …

5
이변 량 정규 분포 데이터에서 타원 영역을 얻는 방법은 무엇입니까?
다음과 같은 데이터가 있습니다. 나는 정규 분포 (커널 밀도 추정은 더 잘 작동하지만 그렇게 큰 정밀도는 필요하지 않음)를 적용하려고 시도했으며 꽤 잘 작동합니다. 밀도 플롯은 타원을 만듭니다. 점이 타원 영역 내에 있는지 여부를 결정하려면 타원 함수를 가져와야합니다. 그렇게하는 방법? R 또는 Mathematica 코드는 환영합니다.
13 r  regression  pdf  bivariate 

5
독립 변수를 표준화하면 공선 성이 감소합니까?
Bayes / MCMC에 대한 좋은 글을 보았습니다. IT는 독립 변수를 표준화하면 MCMC (Metropolis) 알고리즘이 더 효율적일뿐만 아니라 (다중) 공선 성을 줄일 수 있다고 제안합니다. 사실일까요? 이것이 표준으로 해야 할 일입니까? (죄송합니다). Kruschke 2011, 베이지안 데이터 분석. (AP) 편집 : 예를 들어 > data(longley) > cor.test(longley$Unemployed, longley$Armed.Forces) Pearson's product-moment correlation data: …

4
상관 행렬의 고유 값 분포에 대한 직관 / 해석?
상관 행렬의 고유 값 분포에 대한 직관 / 해석은 무엇입니까? 나는 보통 3 개의 가장 큰 고유 값이 가장 중요하고, 0에 가까운 값은 잡음이라는 것을 듣는 경향이 있습니다. 또한, 자연적으로 발생하는 고유 값 분포가 랜덤 상관 행렬 (다시 말해서 신호에서 잡음을 구별)에서 계산 된 것과 고유 값 분포가 어떻게 다른지 …

3
시계열 예측을위한 데이터 보강 전략
시계열 예측에서 "데이터 확대"를 수행하는 두 가지 전략을 고려하고 있습니다. 먼저 약간의 배경 지식이 필요합니다. 시계열의 다음 단계를 예측하기 위한 예측 변수 피피P{ A나는}{ㅏ나는}\lbrace A_i\rbrace 는 일반적으로 시계열 과거 상태와 예측 변수의 과거 상태 두 가지에 의존하는 함수입니다. 피( { A나는 ≤ t - 1} , P에스t - 1)피({ㅏ나는≤티−1},피에스티−1)P(\lbrace A_{i\leq …



3
숨겨진 마르코프 모델과 반복 신경망
각각에 가장 적합한 순차적 입력 문제는 무엇입니까? 입력 차원이 더 적합한 항목을 결정합니까? "더 긴 메모리"가 필요한 문제는 LSTM RNN에 더 적합한 반면, 주기적 입력 패턴 (주식 시장, 날씨)의 문제는 HMM에 의해보다 쉽게 ​​해결됩니까? 겹치는 부분이 많은 것 같습니다. 둘 사이에 어떤 미묘한 차이점이 있는지 궁금합니다.

3
ACF & PACF는 MA 및 AR 용어의 순서를 어떻게 식별합니까?
다른 시계열에서 작업하는 것은 2 년이 넘었습니다. AC 용어가 MA 용어의 순서를 식별하는 데 사용되고 PACF는 AR을 나타내는 데 사용되는 많은 기사를 읽었습니다. MA의 경우 ACF가 갑자기 종료되는 지연은 MA의 순서이며 PACF 및 AR의 경우와 비슷합니다. 다음은 PennState Eberly College of Science 의 기사 중 하나입니다 . 내 질문은 왜 …

2
Google Inception 모델 : 여러 softmax가있는 이유는 무엇입니까?
Google Inception 모델의 토폴로지는 여기에서 찾을 수 있습니다. Google Inception Netowrk 이 모델에는 3 개의 softmax 레이어 (# 154, # 152, # 145)가 있으며 그 중 2 개는이 모델의 초기 이스케이프입니다. 내가 아는 한, softmax 레이어는 최종 출력을위한 것이므로 왜 그렇게 많은가? 다른 2 레이어의 목적은 무엇입니까?

3
순간의 방법은 무엇이며 MLE과 어떻게 다릅니 까?
일반적으로 모멘트 방법은 관측 된 샘플 평균 또는 분산을 이론적 모멘트와 일치시켜 모수 추정치를 얻는 것처럼 보입니다. 이것은 종종 지수 가족의 MLE과 동일합니다. 그러나 가능성 함수의 모드를 찾는 것이 까다로울지라도 모멘트 방법에 대한 명확한 정의와 MLE가 일반적으로 선호되는 이유에 대한 명확한 논의를 찾기는 어렵습니다. 이 질문 은 MLE가 Moment 방법보다 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.