통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
랜덤 포레스트를 사용한 모델링에는 교차 검증이 필요합니까?
내가 본 한, 이것에 대한 의견은 다른 경향이 있습니다. 모범 사례는 특히 교차 검증을 사용하여 지시 할 것입니다 (특히 동일한 데이터 세트에서 다른 알고리즘과 RF를 비교하는 경우). 반면, 원본 출처는 모델 훈련 중에 OOB 오류가 계산된다는 사실은 테스트 세트 성능의 지표로 충분하다고 명시하고 있습니다. 비교적 최근 대화에서 Trevor Hastie조차도 "임의의 …

2
계측기가없는 관측 데이터 모델에 대해 무엇을 말할 수 있습니까?
과거에는 회귀 (및 패널 모델 또는 GLM과 같은 관련 모델)가 관측 데이터 (예 : 통제 된 실험에 의해 생성되지 않은 데이터)에 사용되는 여러 분야의 논문과 관련하여 여러 가지 질문을 받았습니다. 많은 경우에 (항상 그런 것은 아니지만 시간이 지남에 따라 관찰 된 데이터) 그러나 도구 변수를 도입하려고 시도하지 않는 경우. 나는 …



1
고유 한 MVUE 찾기
이 질문은 Robert Hogg의 388 페이지의 수학 통계 6 판 7.4.9 소개에서 발췌 한 것입니다. 하자 PDF 파일과 IID 수 제로 다른 곳 .X1,...,XnX1,...,XnX_1,...,X_nf(x;θ)=1/3θ,−θ<x<2θ,f(x;θ)=1/3θ,−θ<x<2θ,f(x;\theta)=1/3\theta,-\theta0 (가) MLE 찾기 의θ^θ^\hat{\theta}θθ\theta (b)는 에 대한 충분한 통계치 ? 왜 ?θ^θ^\hat{\theta}θθ\theta (c) 은 의 유일한 MVUE 입니까? 왜 ?(n+1)θ^/n(n+1)θ^/n(n+1)\hat{\theta}/nθθ\theta 나는 (a)와 (b)를 풀 수 있다고 …

1
MCMC에서 높은 자기 상관 관리
R과 JAGS를 사용하여 메타 분석을 위해 다소 복잡한 계층 적 베이지안 모델을 만들고 있습니다. 비트를 단순화하면 모형의 두 가지 주요 수준은 α j = ∑ h γ h ( j ) + ϵ j입니다. 여기서 y i j 는 끝점 의 i 번째 관측치입니다 (이 경우 · 연구에 GM 대 …


1
TF-IDF 로그에서 로그 사용 이해
나는 읽고 있었다: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition 그러나 수식이 왜 원래대로 구성되었는지 정확히 이해할 수없는 것 같습니다. 내가 이해하는 것 : iDF는 어떤 수준에서 용어 S가 각 문서에 나타나는 빈도를 측정해야하며, 용어가 더 자주 나타날수록 가치가 감소합니다. 그 관점에서 나는 D F( S) = # 문서의# S를 포함하는 서류나는디에프(에스)=# 문서# S가 포함 된 …

1
Elo 등급 시스템이 왜 잘못된 업데이트 규칙을 사용합니까?
Elo 등급 시스템은 쌍 비교에서 결과의 예상 확률과 관측 확률 사이의 교차 엔트로피 손실 함수의 경사 하강 최소화 알고리즘을 사용합니다. 일반적인 손실 함수를 다음과 같이 작성할 수 있습니다. E=−∑n,ipiLog(qi)E=−∑n,ipiLog(qi) E=-\sum_{n,i} p_i Log (q_i) 여기서 합계는 모든 결과 및 모든 상대 됩니다. 는 이벤트 의 관측 된 주파수 이고 는 예상 …

2
테일러 계열 근사치가 (전체) 기능에 대한 기대치에 언제 수렴됩니까?
일부 일 변량 랜덤 변수 와 전체 함수 대해 형식을 예상하십시오 (즉, 수렴 간격은 전체 실제 선입니다).E(f(X))E(f(X))E(f(X))XXXf(⋅)f(⋅)f(\cdot) 대한 모멘트 생성 기능이 있으므로 정수 모멘트를 쉽게 계산할 수 있습니다. 주위에 Taylor 계열을 사용한 다음 일련의 중심 모멘트 ( 와 관련하여 기대치를 적용합니다. = f (\ mu) + \ sum_ {n = …

1
모든 PLS 구성 요소가 함께 원본 데이터의 일부만 설명하는 이유는 무엇입니까?
10 개의 변수로 구성된 데이터 세트가 있습니다. 이 10 개의 변수로 단일 반응 변수를 예측하기 위해 부분 최소 제곱 (PLS)을 실행하고 10 개의 PLS 성분을 추출한 다음 각 성분의 분산을 계산했습니다. 원래 데이터에서 나는 702 인 모든 변수의 분산의 합을 취했습니다. 그런 다음 각 PLS 구성 요소의 분산을이 합계로 나누어 …

1
표본 비율에 이항 분포가없는 이유
이항 설정에서 성공 횟수를 제공하는 임의의 변수 X는 이항 적으로 분포됩니다. 그런 다음 샘플 비율을 X 로 계산할 수 있습니다 여기서n엑스엔Xn\frac{X}{n}엔nn 은 표본 크기입니다. 내 교과서는 이 비율은 수행 하지 이항 분포 그러나 X 이후 은 단순히 이항 분포 랜덤 변수X의 스케일 버전이며, 이항 분포도없어야합니까?엑스엔Xn\frac{X}{n}엑스XX

1
Laplace가 배포 된 2 개의 평균을 어떻게 비교할 수 있습니까?
1 분 재고 반품에 대해 2 개의 표본 평균을 비교하고 싶습니다. 나는 그들이 Laplace 분산되어 있다고 가정하고 (이미 확인) 반환을 2 그룹으로 나눕니다. 그것들이 크게 다른지 어떻게 확인할 수 있습니까? 값이 300 개가 넘더라도 QQ 플롯은 정규 분포와 큰 차이가 있기 때문에 정규 분포처럼 취급 할 수 없다고 생각합니다.

2
볼록한 순서가 오른쪽 꼬리 우위를 의미합니까?
두 개의 연속 분포 FXFX\mathcal{F}_X 와 주어지면 FYFY\mathcal{F}_Y볼록 우세의 관계가 명확하지 않습니다. (0)FX&lt;cFY(0)FX&lt;cFY(0)\quad \mathcal{F}_X <_c \mathcal{F}_Y 암시 (1)F−1Y(q)≤F−1X(q),∀q∈[0.5,1](1)FY−1(q)≤FX−1(q),∀q∈[0.5,1](1)\quad F_Y^{-1}(q) \leq F_X^{-1}(q),\quad \forall q\in[0.5,1] (1)(1)(1) 을 유지 해야한다면 더 가설이 필요한가 ? 볼록한 지배력의 정의. 두 개의 연속 분포 FXFX\mathcal{F}_X 및 FYFY\mathcal{F}_Y 만족하는 경우 : (2)F−1YFX(x) is convex in x(2)FY−1FX(x) is …

2
정밀도 기반 (즉, 역 분산) ​​가중치가 메타 분석에 필수적인가?
정밀 분석 기반 가중치가 메타 분석의 중심입니까? Borenstein et al. (2009)는 메타 분석이 가능하기 위해서는 다음과 같은 것이 필요하다고 썼다. 연구에 따르면 단일 숫자로 표현할 수있는 포인트 추정치가보고됩니다. 해당 포인트 추정치에 대한 분산을 계산할 수 있습니다. 왜 (2)가 엄격하게 필요한지는 분명하지 않습니다. 그러나 실제로 널리 받아 들여진 메타 분석 방법은 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.