통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
동일하지 않은 분산을 갖는 James-Stein Estimator
James-Stein 추정값에 대해 내가 찾은 모든 진술은 추정되는 랜덤 변수의 분산이 동일하다고 가정합니다. 그러나이 모든 예는 JS 추정기가 서로 관련이없는 수량을 추정하는 데 사용될 수 있다고 언급합니다. 위키 피 디아 예는 몬태나 빛, 대만의 차 소비, 돼지 무게의 속도입니다. 그러나이 세 가지 수량에 대한 측정 결과에는 "실제"차이가있을 수 있습니다. 이것이 …

1
공변량으로 다변량 법선을 사용한 베이지안 모델링
설명 변수 있고 여기서 는 주어진 좌표를 나타냅니다. 응답 변수 있습니다. 이제 두 변수를 다음과 같이 결합 할 수 있습니다.X=(X(s1),…,X(sn))X=(X(s1),…,X(sn)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right)sssY=(Y(s1),…,Y(sn))Y=(Y(s1),…,Y(sn)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) W(s)=(X(s)Y(s))∼N(μ(s),T)W(s)=(X(s)Y(s))∼N(μ(s),T){\bf{W}}({\bf{s}}) = \left( \begin{array}{ccc}X(s) \\ Y(s) \end{array} \right) \sim N(\boldsymbol{\mu}(s), T) 이 경우 간단히 μ(s)=(μ1μ2)Tμ(s)=(μ1μ2)T\boldsymbol{\mu}(s) = \left( \mu_{1} \; \; \mu_{2}\right)^{T} 를 선택하면 TTT 는 공분산 …

1
log (y)를 모델링 할 때 역변환 회귀 결과
에 회귀를 맞추고 있습니다. 지수로 변환점 추정값 (및 신뢰 / 예측 간격)을 역행시키는 것이 유효합니까? 이후로 믿지 않지만 다른 사람의 의견을 원했습니다.log(y)log⁡(y)\log(y)E[f(X)]≠f(E[X])E[f(X)]≠f(E[X])E[f(X)] \ne f(E[X]) 아래의 예는 역변환과의 충돌을 보여줍니다 (.239 대 .219). set.seed(123) a=-5 b=2 x=runif(100,0,1) y=exp(a*x+b+rnorm(100,0,.2)) # plot(x,y) ### NLS Fit f <- function(x,a,b) {exp(a*x+b)} fit <- nls(y ~ …

2
3 방향 반복 측정 분산 분석에 해당하는 lme4 :: lmer는 무엇입니까?
내 질문은 이lme4::lmer 모델이 양방향 반복 측정 ANOVA에 해당 하는 모델 을 보여준 이 응답 을 기반으로 합니다 . require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), …

1
다중 비교에서 p- 값을 언제 수정해야합니까?
관련 질문에 대한 답변이없는 것 같습니다. > 2 분류기 (기계 학습)의 성능을 평가합니다. 우리의 Null 가설은 성능이 다르지 않다는 것입니다. 이 가설을 평가하기 위해 모수 (ANOVA) 및 비모수 (Friedman) 검정을 수행합니다. 중요한 경우 사후 퀘스트에서 어떤 분류 기준이 다른지 알아 내고 싶습니다. 내 질문은 두 가지입니다. 1) 다중 비교 테스트 …

2
제곱 감마의 기대
감마 분포가 및 매개 변수화되는 경우 :αα\alphaββ\beta E(Γ(α,β))=αβE(Γ(α,β))=αβ E(\Gamma(\alpha, \beta)) = \frac{\alpha}{\beta} 제곱 감마의 기대치를 계산하고 싶습니다. E(Γ(α,β)2)=?E(Γ(α,β)2)=? E(\Gamma(\alpha, \beta)^2) = ? 나는 그것이 생각 합니다 : E(Γ(α,β)2)=(αβ)2+αβ2E(Γ(α,β)2)=(αβ)2+αβ2 E(\Gamma(\alpha, \beta)^2) = \left(\frac{\alpha}{\beta}\right)^2 + \frac{\alpha}{\beta^2} 후자의 표현이 올바른지 아는 사람이 있습니까?

1
이 연속 데이터에 부트 스트랩이 적합합니까?
나는 완전한 초보자입니다 :) 약 745,000 명의 인구에서 10,000의 표본 크기로 연구하고 있습니다. 각 샘플은 "백분율 유사성"을 나타냅니다. 대부분의 표본은 약 97 % -98 %이지만 일부는 60 %와 90 % 사이입니다. 즉, 분포가 크게 부정적입니다. 결과의 약 0.6 %는 0 %이지만 샘플과 별도로 처리됩니다. 모든 10,000 샘플의 평균은 97.7 %이며 …

1
비모수 적 테스트에서 다중 비교
비모수 적이며 12 개의 처리가있는 데이터 세트로 작업하고 있습니다. 나는 Kruskal-Wallis 테스트를 수행하고 유의 한 값을 얻었으며 , 이제는 어떤 처리가 유의하게 다른지 확인하기 위해 다중 비교 절차를 수행하고 싶습니다. 이 주제에 관한 많은 정보가 있지만이 문제를 구체적으로 다루는 것을 찾지 못했습니다. 어떤 아이디어 ?? 피pp

1
오프라인과 온라인 학습의 모델 선택
나는 최근 온라인 학습에 대해 더 많이 배우려고 노력했지만 (절대적으로 흥미 롭습니다!) 내가 잘 이해하지 못한 주제 중 하나는 오프라인과 온라인 컨텍스트에서 모델 선택에 대해 생각하는 방법입니다. 특히, 일부 고정 데이터 세트 에 따라 분류 자 오프라인으로 학습한다고 가정 합니다. 예를 들어, 교차 검증을 통해 성능 특성을 추정하고이 방법으로 가장 …

6
비지도 학습에서 기능 선택을 수행하는 R 또는 Python의 메소드 [닫기]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 2 년 전 . R / Python에서 데이터에서 중요하지 않은 / 중요한 기능을 삭제 / 선택할 수있는 방법 / 구현 방법은 무엇입니까? 내 데이터에는 라벨이 없습니다 (감독되지 …

2
로지스틱 회귀 분석에서 상대 변수 중요도를 p로 정량화하는 방법은 무엇입니까?
로지스틱 회귀 모델을 사용하여 온라인 구매자가 일련의 온라인 광고 (예측 자 : Ad1, Ad2 및 Ad3)를 클릭 한 후 제품을 구매할지 (결과 : 구매) 여부를 예측한다고 가정합니다. 결과는 1 (구매) 또는 0 (구매되지 않음)의 이진 변수입니다. 예측 변수는 1 (클릭) 또는 0 (클릭)의 이진 변수입니다. 따라서 모든 변수의 규모가 같습니다. …

3
연속 데이터가 0으로 쌓인 GLM
TB, AIDS와 같은 치명적인 질병이 입원 비용에 얼마나 영향을 미치는지 추정하기 위해 모델을 실행하려고합니다. 나는 의존적 변수로 "입원 당 비용"을, 독립 변수로 다양한 개별 마커를 가지고 있으며, 거의 모두 성별, 세대주, 빈곤 상태 및 병이 있는지 여부에 대한 더미 (더하기 연령)와 같은 더미입니다. 그리고 연령 제곱)과 많은 상호 작용 용어. …

1
첨도의 강력한 추정?
첨도에 대해 일반적인 추정량 인 하고 있지만 경험적 분포에서 작은 '이상 값'도 발견했습니다. 즉, 중심에서 멀리 떨어진 작은 봉우리가 엄청나게 영향을 미칩니다. 보다 강력한 첨도 추정기가 있습니까?케이^= μ^4σ^4케이^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}

1
PCA와 PLS에서 "로드"와 "상호로드"의 차이점은 무엇입니까?
PCA (Principal Component Analysis)를 수행 할 때 공통적으로 수행해야 할 한 가지는 변수 간의 관계를 조사하기 위해 서로에 대해 두 개의 하중을 플로팅하는 것입니다. 주성분 회귀 및 PLS 회귀를 수행하기위한 PLS R 패키지 와 함께 제공되는 논문 에는 상관 부하 그림 (종이의 그림 7 및 15 페이지 참조) 이라는 다른 …

3
선형 회귀 분석에서 백분율 결과를 사용하는 데 어떤 문제가 있습니까?
많은 결과가 백분율과 같이 표현되는 연구가 있으며 이러한 결과에 대한 일부 범주 형 변수의 영향을 평가하기 위해 여러 선형 회귀 분석을 사용하고 있습니다. 선형 회귀 분석 결과가 연속 분포라고 가정하기 때문에 이러한 모델을 백분율에 적용하는 방법 론적 문제가 있습니까? 0과 100 사이로 제한됩니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.