통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
R의 glmnet을 사용한 릿지 회귀와 파이썬의 scikit-learn의 차이점은 무엇입니까?
James, Witten, Hastie, Tibshirani (2013) 의 저서 'R의 통계 학습에 대한 통계 학습 소개' 에서 Ridge Regression / Lasso에 대한 LAB 섹션 §6.6을 살펴 보겠습니다 . 보다 구체적으로, scikit-learn Ridge모델을 R 패키지 'ISLR'의 'Hitters'데이터 세트에 적용하려고합니다 . R 코드에 표시된 것과 동일한 기능 세트를 작성했습니다. 그러나 glmnet()모델 의 결과에 가까이 …

1
전체 p- 값 및 페어 단위 p- 값?
로그 가능성이 인 일반 선형 모델 .L u와이= β0+ β1엑스1+ β2엑스2+ β삼엑스삼,y=β0+β1x1+β2x2+β3x3,y=\beta_0+\beta_1x_1+\beta_2x_2+\beta_3x_3,엘유LuL_u 이제 계수가 같은지 테스트하고 싶습니다. 첫째, 전체 테스트 : 축소 된 모델 의 로그 가능성 은 입니다. 우도 비 검정에 따르면 전체 모형이 축소 모형보다 훨씬 낫습니다 .와이= β0+ β1⋅ ( x1+ x2+ x삼)y=β0+β1⋅(x1+x2+x3)y=\beta_0+\beta_1\cdot(x_1+x_2+x_3) p = 0.02엘아르 자형LrL_rp …

2
제한된 최대 우도가 왜 분산의 더 나은 (편견없는) 추정치를 산출합니까?
나는 R의 lme4 패키지에 대한 Doug Bates의 이론 논문 을 읽고 혼합 모델의 핵심을 더 잘 이해하고 있으며 제한된 최대 우도 (REML)를 사용하여 분산을 추정하는 것에 대해 더 잘 이해하고 싶은 흥미로운 결과를 발견했습니다. . REML 기준의 3.3 절에서 분산 추정에 REML을 사용하는 것은 적합 선형 모형의 잔차 편차로부터 분산을 …

1
카이 제곱 테스트는 어떤 기능 선택을 사용할 수 있습니까?
여기에서는 다른 사람들이지도 학습에서 기능 선택 wrt 결과에 카이 제곱 테스트를 사용하기 위해 일반적으로 수행하는 작업에 대해 묻고 있습니다. 올바르게 이해하면 각 기능과 결과 사이의 독립성을 테스트하고 각 기능에 대한 테스트 사이의 p 값을 비교합니까? 에서 http://en.wikipedia.org/wiki/Pearson%27s_chi-squared_test , Pearson의 카이 제곱 검정은 범주화 된 데이터 세트에 적용되는 통계 테스트로 , …

2
중앙값에 대한 신뢰 구간을보고하는 것이 왜 흔하지 않은가?
응용 과학 논문에서보고 된 신뢰 구간을 찾는 것이 왜 그렇게 흔하지 않은가? 나는 주로 컴퓨터 과학을 다루지 만 종종 (사회) 심리학, 사회학 및 도시 계획에서 논문을 읽습니다. 보고 된 중앙값에 대한 CI를 본 것을 기억할 수 없습니다. 동시에, 신뢰 구간 등을 연구하는 동안, 중앙값이 자신의 데이터를 더 잘 설명하는 모든 …


2
lmer로부터 자유도 확보
나는 출력을 구성했지만 다음과 같은 lmer 모델을 적합시켰다. Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 다음 공식을 사용하여 각 효과에 대한 신뢰 구간을 만들고 싶습니다. ( n - 1 ) s2χ2α / 2 , n - 1, ( n - 1 ) s2χ21 − …

3
“반전 된”Shapiro–Wilk
Wikipedia 에 따르면 Sharipo-Wilk 검정은 귀무 가설 ( ) "집단이 정상적으로 분포되어 있음"을 검정 합니다.H0H0H_0 "인구 가 정상적으로 분포 되어 있지 않습니다 " 와 유사한 정규성 검정을 찾고 있습니다.H0H0H_0 이러한 테스트 를 통해 유의 수준에서 을 기각 하기 위해 값 을 계산하고 싶습니다. iff ; 제 인구가 정상적으로 분포되어 있음을 …

3
공분산 행렬이 양의 명확하지 않은 경우 요인 분석을 수행하는 방법은 무엇입니까?
33 개의 변수 (열)로 설명되는 717 개의 관측치 (행)로 구성된 데이터 세트가 있습니다. 모든 변수는 z- 점수로 데이터를 표준화합니다. 두 변수가 선형 적으로 종속되지 않습니다 ( ). 또한 분산이 매우 낮은 ( 미만 ) 모든 변수를 제거했습니다 . 아래 그림은 해당 상관 매트릭스를 보여줍니다 (절대 값).r = 1아르 자형=1r=10.10.10.1 factoranMatlab에서 …

2
보통 위시 아트 후손의 유도
나는 Normal-Wishart 후부의 파생을 연구하고 있지만 매개 변수 중 하나 (스케일 매트릭스의 후부, 아래쪽 참조)에 붙어 있습니다. 맥락과 완전성을 위해 다음은 모델과 나머지 파생물입니다. xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ \boldsymbol{\Lambda} &\sim \mathcal{W}(\upsilon_0, \mathbf{W}_0) \end{align} 세 가지 요소 각각의 확장 된 형태는 다음과 같습니다 (최대 비례 …

1
최소 위험 분류기의 계산 임계 값?
두 클래스 및 에 속성 가 있고 분포가 및 합니다. 다음 비용 매트릭스에 대해 동일한 사전 경우 :C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} 왜, 가 최소 위험 (비용) 분류기의 임계 값입니까?x0&lt;0.5x0&lt;0.5x_0 < 0.5 이것은 내가 오해하는 나의 주 예입니다 …

1
샘플링 변수를 사용한 혼합 효과 모델 설계
선형 혼합 효과 모델의 공식을 지정하려고합니다. lme4실험 설계 )에 대한 하지만 제대로하고 있는지 확실하지 않습니다. 디자인 : 기본적으로 나는 식물에 대한 반응 매개 변수를 측정하고 있습니다. 나는 4 가지 수준의 치료와 2 가지 관개 수준을 가지고 있습니다. 식물은 16 개의 플롯으로 그룹화되며, 각 플롯 I에서 4 개의 하위 플롯을 샘플링합니다. …

1
과적 합 데이터없이 최적을 선택하는 방법은 무엇입니까? N 정규 함수 등을 사용하여 바이 모달 분포 모델링
나는 명백하게 이분법적인 가치 분포를 가지고 있는데, 나는 그것을 추구한다. 데이터는 2 개의 일반 기능 (바이 모달) 또는 3 개의 일반 기능에 잘 맞습니다. 또한 데이터를 3에 맞추는 데에는 그럴듯한 물리적 이유가 있습니다. 도입 된 매개 변수가 많을수록 충분한 상수를 사용하면 " 코끼리를 맞출 수있다"는 것처럼 완벽하게 맞을 수 있습니다 …

1
null 및 모델 편차를 사용하여 GLM 모델 테스트
나는 R에서 glm 모델을 만들고 테스트 및 교육 그룹을 사용하여 테스트 했으므로 잘 작동한다고 확신합니다. R의 결과는 다음과 같습니다. Coefficients: Estimate Std. Error t value Pr(&gt;|t|) (Intercept) -2.781e+00 1.677e-02 -165.789 &lt; 2e-16 *** Coeff_A 1.663e-05 5.438e-06 3.059 0.00222 ** log(Coeff_B) 8.925e-01 1.023e-02 87.245 &lt; 2e-16 *** log(Coeff_C) -3.978e-01 7.695e-03 -51.689 …


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.