통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
다항 분포 계수의 합
\newcommand{\P}{\mathbb{P}} 공정한 주사위를 던지고 있습니다. 1, 2 또는 3을 얻을 때마다 '1'을 기록합니다. 4를 얻을 때마다 '2'를 기록합니다. 5 또는 6을 얻을 때마다 '3'을 기록합니다. 내가 적어 모든 숫자의 곱에 필요한 총 던지기 수를 이라고합시다 . . 을 계산하거나 근사값을 정규 분포의 함수로 제공 할 수 있습니다.NNN≥100000≥100000\geq 100000P(N≥25)P(N≥25)\P(N\geq 25) 먼저 …

2
R (lme4)과 혼합 효과를 나타 내기 위해 데이터를 시뮬레이션하는 방법은 무엇입니까?
이 게시물에 대응하기 위해 연속 변수를 사용하여 데이터를 시뮬레이션하고 상관 된 절편과 기울기에 대출했습니다. 사이트 와 사이트 외부 에이 주제 에 대한 훌륭한 게시물이 있지만 간단한 실제 시나리오와 비슷한 시뮬레이션 된 데이터를 사용하여 처음부터 끝까지 예제를 작성하는 데 어려움이있었습니다. 따라서 문제는 이러한 데이터를 시뮬레이션하고로 "테스트"하는 방법입니다 lmer. 많은 사람들에게 새로운 …

1
간격과 표본 평균의 비율 분포는 무엇입니까?
하자 평균이 IID 지수 확률 변수의 샘플 수 및하자 이 샘플의 수의 순서 통계. 하자 .X1,…,XnX1,…,XnX_1,\dots,X_nββ\betaX(1),…,X(n)X(1),…,X(n)X_{(1)},\dots,X_{(n)}X¯=1n∑ni=1XiX¯=1n∑i=1nXi\bar X = \frac{1}{n}\sum_{i=1}^n X_i 간격을 정의하십시오.이 도시 될 수있다 각 것을 함께 평균도 기하 급수적 .W i β i = βWi=X(i+1)−X(i) ∀ 1≤i≤n−1.Wi=X(i+1)−X(i) ∀ 1≤i≤n−1.W_i=X_{(i+1)}-X_{(i)}\ \forall\ 1 \leq i \leq n-1\,. WiWiW_iβi=βn−iβi=βn−i\beta_i=\frac{\beta}{n-i} 질문 : …

1
iid 랜덤 변수의 예상 값
내가 이해하지 못하는이 파생을 발견했습니다 이 평균 및 분산 의 모집단에서 가져온 크기 n의 임의 샘플 인 경우X1,X2,...,XnX1,X2,...,XnX_1, X_2, ..., X_nμμ\muσ2σ2\sigma^2 X¯=(X1+X2+...+Xn)/nX¯=(X1+X2+...+Xn)/n\bar{X} = (X_1 + X_2 + ... + X_n)/n E(X¯)=E(X1+X2+...+Xn)/n=(1/n)(E(X1)+E(X2)+...+E(Xn))E(X¯)=E(X1+X2+...+Xn)/n=(1/n)(E(X1)+E(X2)+...+E(Xn))E(\bar{X}) = E(X_1 + X_2 + ... + X_n)/n = (1/n)(E(X_1) + E(X_2) + ... + E(X_n)) E(X¯)=(1/n)(μ+μ+...n times)=μE(X¯)=(1/n)(μ+μ+...n times)=μE(\bar{X}) …


1
요인 분석에서 이진 변수에 대한 Pearson 상관 관계 (테트라 코릭 대신)를 계산할 때 어떤 위험이 있습니까?
교육 게임에 대한 연구를하고 있으며 현재 진행중인 일부 프로젝트에는 BoardGameGeek (BGG) 및 VideoGameGeek (VGG)의 데이터를 사용하여 게임의 디자인 요소 (예 : "제 2 차 세계 대전에서 설정 됨", "롤링 주사위 포함") 간의 관계를 조사합니다. ) 및 해당 게임의 플레이어 등급 (예 : 10 점 만점). 이러한 각 디자인 요소는 BGG …

2
대체하지 않고 독립적 인 무작위 샘플의 교차점의 카디널리티 분포는 무엇입니까?
SSS 는n∈Nn∈Nn\in\mathbb{N} 요소와a1,a2,...,ama1,a2,...,ama_1,a_2,...,a_m 보다 작은 양의 정수를 고정 또는 동등한nnn . 의 원소 SSS가 똑같이 가능성이 있기 때문에, mmm 은 샘플링한다 . . . , L의 m은L1,L2,...,LmL1,L2,...,LmL_1, L_2,...,L_m 각각 개별적으로로부터 인출되는 SSS 의 크기는, 여분없이 1 , 2 , . . . , m 각각.a1,a2,...,ama1,a2,...,ama_1,a_2,...,a_m |L1∩L2∩ ... ∩Lm||L1∩L2∩ ... ∩Lm|\left|L_1\cap …

2
Infill Asymptotics의 수학적 정의
나는 채우지 않는 무증상을 사용하는 논문을 작성 중이며 리뷰어 중 한 명이 채워지지 않은 무증상이 무엇인지에 대한 엄격한 수학 정의를 제공하도록 요청했습니다 (즉, 수학 기호 및 표기법 사용). 나는 문헌에서 어떤 것도 발견 할 수 없었고 누군가 누군가 나를 지시하거나 자기 스스로 정의한 내용을 제공 할 수 있기를 바랐다. 불완전 …

2
주성분 분석을 비정규 데이터에 사용할 수 있습니까?
나는 기계 학습을위한 기계 학습 책에 주어진 예를 읽고 있습니다. 먼저 예를 자세히 설명한 다음 내 질문에 대해 이야기하겠습니다. 예 : 25 년간의 주가 10 년 동안 데이터 세트를 가져옵니다. 25 주가로 PCA를 운영합니다. 주성분을 다우 존스 지수와 비교합니다. PC와 DJI의 유사성이 매우 높습니다! 내가 이해 한 바에 따르면,이 예는 …

2
표기법은 정확히 무엇을 의미합니까?
x ˙ ∼ N ( 0 , 1 ) 과 같은 문맥에서 표기 (물결표)는 무엇을 의미 합니까?∼˙∼˙\dot\simx ∼˙엔( 0 , 1 )x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1) 올바르게 입력하는 방법을 찾는 것이 더 쉽다는 것이 밝혀졌습니다 . tex.SE는 간격 문제를 해결하는 \mathrel{\dot\sim}대신 \dot\sim실제로 의미를 찾는 것보다 입력해야한다고 설명 합니다 . 지금까지 CV …

3
범주 형 변수의 대중적이거나 일반적인 조합을 찾기 위해 사용할 수있는 통계적 방법은 무엇입니까?
polydrug 사용에 관한 연구를하고 있습니다. 400 명의 마약 중독자에 대한 데이터 세트가 있는데, 이들은 각각 자신이 남용하는 약물을 언급했습니다. 10 가지가 넘는 약물이 있으므로 가능한 큰 조합이 있습니다. 나는 그들이 소비하는 약물의 대부분을 이진 변수로 기록했다. 2 가지 또는 3 가지 약물의 대중적이거나 일반적인 조합을 찾고 싶습니다. 사용할 수있는 통계적 …

3
auto.arima ()의 p, d 및 q를 읽는 방법은 무엇입니까?
에 의해 추정 된 모델의 p,d and q값을 어떻게 얻을 수 있습니까?ARIMA(p,d,q)auto.arima(mytimeseries) arima_model <-auto.arima (mytimeseries, ic = 'bic') 우리가 출력을 보면 arima_model $ arma 우리는 얻는다 [1] 1000 0 2 0 위 순서대로 숫자의 의미는 무엇입니까?
10 r  arima 

1
증명 / 반증
증명 / 반증E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1_A | \mathscr{F_t}] = 0 \ \text{or} \ 1 \ \text{a.s.} \ \Rightarrow E[1_A | \mathscr{F_{s}}] = E[1_A | \mathscr{F_t}] \ \text{a.s.} 필터링 확률 공간이 주어 ,하자 .(Ω,F,{Fn}n∈N,P)(Ω,F,{Fn}n∈N,P)(\Omega, \mathscr{F}, \{\mathscr{F}_n\}_{n \in \mathbb{N}}, \mathbb{P})A∈FA∈FA \in \mathscr{F} 가정 이 따릅니 …

1
2x2 및 Ix2 (단일 요인-이항 반응) 우발성 테이블의 로지스틱 회귀 분석 대 카이 제곱?
2x2 및 Ix2 우발성 테이블에서 로지스틱 회귀의 사용을 이해하려고합니다. 예를 들어, 이것을 예로 사용 카이 제곱 검정과 로지스틱 회귀 분석의 차이점은 무엇입니까? 다음과 같이 여러 명목 요소 (Ix2 테이블)가있는 테이블은 어떻습니까? 거기에 비슷한 질문입니다 여기가 -하지만 대답은 카이 제곱이 MXN 테이블을 처리 할 수있는 중심이다,하지만 내 질문은 바이너리 결과 단일 …

1
PCA가 한 쌍의 큰 거리 만 보존한다는 것은 무엇을 의미합니까?
나는 현재 t-SNE 시각화 기술을 읽고 있으며 고차원 데이터를 시각화하기 위해 PCA (Principal Component Analysis)를 사용하는 단점 중 하나는 점 사이의 큰 쌍 거리를 유지한다는 것입니다. 고차원 공간에서 멀리 떨어져있는 의미 점은 저 차원 부분 공간에서도 멀리 떨어져 있지만 다른 모든 쌍방향 거리는 망칠 수 있습니다. 왜 그런지 이해하고 그래픽으로 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.