통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
Borel-Cantelli Lemma와 관련된 질문
노트 : Borel-Cantelli Lemma는 다음과 같이 말합니다. ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 그때, 만약 ∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty Borel-Cantelli Lemma를 사용하여 나는 그것을 보여주고 싶다 먼저 limn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n) …

1
변수 모형에서 오차가없는 것보다 더 나은 결과를 달성하는 회귀에 대한 편향 추정기
일부 연구를 위해 Error In Variable 모델에 대한 일부 구문 데이터를 연구하고 있습니다. 현재 단일 독립 변수가 있으며 종속 변수의 실제 값에 대한 분산을 알고 있다고 가정합니다. 따라서이 정보를 사용하여 종속 변수의 계수에 대한 편견 추정량을 얻을 수 있습니다. 모델: , Y=0.5(X)-(10)+E(2)여기서, E1~N(0,σ2)일부σ예2~N(0,1)엑스~= x + e1x~=x+e1\tilde{x} = x + e_1 …


1
합의 평균 또는 평균이 부록의 합보다 큰 경우 무엇을 의미합니까?
네트워크 대기 시간 분포를 분석하고 있습니다. 중간 업로드 시간 (U)은 0.5 초입니다. 평균 다운로드 (D) 시간은 2 초입니다. 그러나 총 평균 시간 (각 데이터 포인트에 대해 T = U + D)은 4 초입니다. 합의 중앙값이 부록의 중앙값의 합보다 훨씬 크다는 것을 알면 어떤 결론을 이끌어 낼 수 있습니까? 통계에 대한 …

1
변수 대 잠재 변수
나는 이것에 대해 전에 물었고 모델 매개 변수를 만드는 것과 잠복 변수를 만드는 것을 식별하는 데 어려움을 겪었습니다. 따라서이 사이트 에서이 주제에 대한 다양한 스레드를 살펴보면 주요 차이점은 다음과 같습니다. 잠복 변수는 관찰되지 않지만 변수 및 매개 변수도 관찰되지 않으며 변수와 관련이 없으므로 분포가 없습니다. 이는 상수이며 고정하지만 알 수없는 …

1
가산 오차 또는 곱셈 오차?
통계에 익숙하지 않아서 이해하는 데 도움이 될 것입니다. 내 분야에는 일반적으로 사용되는 형식의 모델이 있습니다. Pt=Po(Vt)αPt=Po(Vt)αP_t = P_o(V_t)^\alpha 사람들이 모델을 데이터에 맞추면 일반적으로 모델을 선형화하고 다음에 적합합니다. log(Pt)=log(Po)+αlog(Vt)+ϵlog⁡(Pt)=log⁡(Po)+αlog⁡(Vt)+ϵ\log(P_t) = \log(P_o) + \alpha \log(V_t) + \epsilon 이거 괜찮아? 신호의 노이즈로 인해 실제 모델은 Pt=Po(Vt)α+ϵPt=Po(Vt)α+ϵP_t = P_o(V_t)^\alpha + \epsilon 위와 같이 선형화 …

3
왜의 추적
모델 에서 정규 방정식을 사용하여 를 추정 할 수 있습니다 .β와이= Xβ+ ϵy=Xβ+ϵ{y} = X \beta + \epsilonββ\beta Y =X β .β^= ( X'엑스)− 1엑스'와이,β^=(X′X)−1X′y,\hat{\beta} = (X'X)^{-1}X'y, 우리가 얻을 수있는와이^= Xβ^.y^=Xβ^.\hat{y} = X \hat{\beta}. 잔차 벡터는 다음과 같이 추정됩니다. ϵ^= y− Xβ^= ( 난− X( X'엑스)− 1엑스') y= Q y= …



2
R을 이용한 시계열 분석 절차 및 방법
앞으로 6 개월 동안 원자재 (석유, 알루미늄, 주석 등)의 가격을 예측하려는 소규모 프로젝트를 진행하고 있습니다. 예측할 12 가지 변수가 있으며 2008 년 4 월-2013 년 5 월의 데이터가 있습니다. 예측은 어떻게해야합니까? 나는 다음을 수행했다. 시계열 데이터 세트로 가져온 데이터 모든 변수의 계절성은 추세에 따라 달라지는 경향이 있으므로 곱셈 모델을 사용하겠습니다. …


3
최대 가능성 또는 한계 가능성 중 어느 것이 더 좋은가?
회귀 분석을 수행하는 동안 다음과 같은 정의로 가면 : 부분 우도, 프로파일 우도 및 한계 우도의 차이점은 무엇입니까? 그 최우 L 극대화 찾기 β 및 θ (β, θ | 데이터). , Marginal Likelihood 우리는 β에 조건부 θ의 확률 분포를 식별 할 수 있다는 사실을 이용하여 가능성 방정식에서 θ를 통합합니다. 더 …

1
Engle–Granger 2 단계 방법을 사용하여 두 시계열 간의 공적분 테스트
두 시계열 간의 공적분을 테스트하려고합니다. 두 시리즈 모두 ~ 3 년에 걸친 주간 데이터를 가지고 있습니다. Engle-Granger Two Step Method를 시도하고 있습니다. 내 작업 순서는 다음과 같습니다. Augmented Dickey-Fuller를 통해 각 시계열에 단위 루트를 테스트합니다. 둘 다 단위 루트가 있다고 가정하면 OLS를 통해 관계의 선형 근사를 찾으십시오. 그런 다음 일련의 …

4
비즈니스 환경에서 통계 분석을위한 모범 사례
(이것은 통계에 관한 것이 아니라 비즈니스 환경에서의 통계 보급에 관한 것이므로 CV의 주제 범위 내에 있다고 가정했습니다) 간단한 배경 : 우리의 비즈니스 환경 (및 다른 환경이 의심되는 경우)에는 통계 분석 및 연구를 전문으로하는 지원 기능이 있습니다. 우리는 비즈니스 인텔리전스와 긴밀히 협력하며 다른 부서에서 업무를 수행하도록 의뢰됩니다. 사실상 데이터, 분석 및 …

3
Wilcoxon 검정
윌 콕슨이 순위 테스트는 서명의 그것은 점근 상대 효율 (ARE) 것으로 잘 알려져있다 학생에 비해 t -test, 데이터는 정규 분포를 인구에서 도출되는 경우. 이것은 기본 1 샘플 테스트와 2 개의 독립적 인 샘플 (Wilcoxon-Mann-Whitney U)의 변형 모두에 해당됩니다. 또한 정상 데이터의 경우 ANOVA F 테스트와 비교 한 Kruskal-Wallis 테스트의 ARE입니다 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.