통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
피어슨의 잔차
적합도에 대한 카이-제곱 검정의 맥락에서 피어슨 잔차에 대한 초보자의 질문 : 검정 통계량뿐만 아니라 R의 chisq.test함수는 Pearson의 잔차를보고합니다. (obs - exp) / sqrt(exp) 표본이 작을수록 차이가 작기 때문에 관측 값과 기대 값의 원시 차이를 보는 것이 그다지 유익하지 않은 이유를 이해합니다. 그러나 분모의 효과에 대해 더 알고 싶습니다. 왜 예상 …

1
구리 밀도의 상한?
Fréchet-Hoeffding 상한 접합부 분포 함수에 적용하고이 주어진다 C(u1,...,ud)≤min{u1,..,ud}.C(u1,...,ud)≤min{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. CDF 대신에 copula density 대한 상한 (마진 밀도에 의존한다는 의미) 상한이 있습니까?c(u1,...,ud)c(u1,...,ud)c(u_1,...,u_d) 모든 참조는 대단히 감사하겠습니다.

1
주어진
nnn 번째 누적이 1 로 주어진 분포에 대한 정보가 있습니까?1n1n\frac 1 n ? 누적 생성 함수는 κ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ 1 \frac{e^{tx} - 1}{x} \ dx. 나는 임의의 변수의 제한 분포로 그것을 가로 질러 보았지만 그것에 대한 정보를 찾을 수 없었습니다.

1
STL 창 너비 설정 기준
RSTL 분해를 수행하는 데 사용s.window 하여 계절 구성 요소가 얼마나 빠르게 변경 될 수 있는지 제어합니다. 값이 작을수록 더 빠른 변화가 가능합니다. 계절 창을 무한으로 설정하는 것은 계절 구성 요소를 주기적으로 (즉, 수년에 걸쳐 동일하게) 강제하는 것과 같습니다. 내 질문 : 121212s.window 그것과 시계열 주파수 사이에 어떤 링크가 있습니까?

1
클러스터 데이터에 적합한 부트 스트랩 기술?
강력한 클러스터링이 존재하는 데이터에 사용할 적절한 부트 스트랩 기술에 대한 질문이 있습니다. 모델이 가장 높은 세션 빈도를 포함하는 치료 에피소드를 얼마나 잘 예측하는지 결정하기 위해 최신 클레임 데이터에서 현재 기준선 모델을 평가하여 보험 청구 데이터에 대한 다변량 혼합 효과 예측 모델을 평가하는 작업을 수행했습니다. 95 번째 백분위 수). 감도, 특이성 …

2
불균형 데이터 세트에 대한 교육 접근법
불균형 테스트 데이터 세트가 있습니다. 양수 세트는 100 건으로 구성되고 음수 세트는 1500 건으로 구성됩니다. 훈련 측면에는 더 큰 후보 풀이 있습니다. 긍정적 훈련 세트는 1200 건이고 부정적인 훈련 세트는 12000 건입니다. 이런 종류의 시나리오에는 몇 가지 선택이 있습니다. 1) 전체 교육 세트에 가중치 SVM 사용 (P : 1200, N …

3
교과서에없는 선택적 중지 규칙
중지 규칙은 P- 값과 의사 결정과 관련된 오류율 간의 관계에 영향을줍니다. Simmons 등의 최근 논문. 2011 년 에는 연구자 자유도 라는 용어 가 재현 불가능한 것으로 밝혀진 심리학 문헌의 많은 보고서를 담당하는 것으로 간주되는 행동의 모음을 설명합니다. 이러한 행동 중, 선택적인 중지 규칙 또는 선언되지 않은 임시 분석은 현재 내가 …

2
평균 분산이 관심이있을 때 계층 적 베이 시산 모델의 분산에 어떤 사전 분포를 사용할 수 있습니까?
그의 널리 인용 된 논문 에서 계층 적 모델의 분산 모수에 대한 사전 분포 Gelman은 계층 적 베이지안 모델의 분산에 대한 유익한 비 정보 적 사전 분포가 균일 분포와 반 t 분포라고 제안합니다. 내가 올바르게 이해하면 위치 매개 변수 (예 : 평균)가 주요 관심사 일 때 잘 작동합니다. 경우에 따라 …

4
낮은 분류 정확도, 다음에 수행 할 작업
그래서 저는 ML 분야의 초보자이며 분류를하려고합니다. 내 목표는 스포츠 이벤트의 결과를 예측하는 것입니다. 나는 몇 가지 역사적 데이터를 수집했으며 이제 분류기를 훈련하려고합니다. 나는 약 1200 개의 샘플을 얻었고, 그중 0.2 개는 테스트 목적으로 분리되었으며 다른 샘플은 다른 분류 기준으로 그리드 검색에 포함되었습니다 (교차 유효성 검사 포함). 나는 선형, rbf 및 …

2
Laplace 분산 (이중 지수) 데이터 또는 매개 변수를 생성 할 수있는 프로세스는 무엇입니까?
많은 배포판에는 "원산지 신화"또는 잘 설명 된 물리적 프로세스의 예가 있습니다. 중앙 한계 정리 (Central Limit Theorem)를 통해 상관되지 않은 오류의 합계에서 정규 분포 데이터를 얻을 수 있습니다. 독립적 인 코인 플립 또는이 프로세스의 한계에서 푸 아송 분포 변수에서 이항 분포 데이터를 얻을 수 있습니다. 일정한 감쇠율로 대기 시간에서 기하 …

3
감마-포아송이 무엇인지에 따라 포아송은 기하 급수적으로 증가합니까?
푸 아송 분포는 단위 시간당 이벤트를 측정 할 수 있으며 모수는 λλ\lambda 입니다. 지수 분포는 매개 변수 1을 사용하여 다음 이벤트까지의 시간을 측정합니다.1λ1λ\frac{1}{\lambda} . 이벤트 또는 시간을 모델링하기 쉬운 지 여부에 따라 하나의 분포를 다른 분포로 변환 할 수 있습니다. 이제 감마-포아송은 더 큰 분산을 갖는 "신축 된"포아송입니다. 와 이블 …

4
DNA 시퀀싱을위한 음 이항 분포 구하기
음의 이항 분포는 생물 정보학에서 카운트 데이터 (특히 주어진 실험으로부터 게놈의 주어진 영역 내에서 예상되는 수의 서열 판독 횟수)에 대한 대중적인 모델이되었다. 설명은 다양합니다. 일부는 이것을 포아송 분포와 같이 작동하지만 추가 모수를 가지므로 평균과 반드시 ​​같지 않은 분산으로 실제 분포를 더 자유롭게 모델링 할 수 있습니다. 일부는 이것을 포아송 분포의 …

1
가우스 copula에서 시뮬레이션하는 방법?
시뮬레이션 할 수 있는 두 개의 일 변량 한계 분포 (예 : 및 G) 가 있다고 가정합니다 . 이제 C ( F , G ; Σ) 로 표시 되는 가우스 copula를 사용하여 관절 분포를 구성하십시오 .FFFGGG. 모든 매개 변수가 알려져 있습니다.C(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) 이 copula에서 시뮬레이션하기위한 비 MCMC 방법이 있습니까?

3
중앙값의 편견 추정치
[ 0 , 1 ] 에서 지원되는 랜덤 변수 X 가 있다고 가정 해 봅시다 . X 의 중앙값에 대한 편견없는 추정값을 어떻게 얻을 수 있습니까?XX[0,1][0,1]XX 물론 일부 샘플을 생성하고 샘플 중앙값을 취할 수는 있지만 이것이 일반적으로 편향되지는 않는다는 것을 이해합니다. 참고 :이 질문은 내 마지막 질문 과 관련이 있지만 …
16 sampling 

3
시퀀스 데이터에서 Markov 전환 확률 추정
4 가지 상태 의 전체 시퀀스 세트 (정확한 432 개의 관측치)가 있습니다 .A−DA−DA-D 와이= ⎛⎝⎜⎜⎜⎜ㅏ비⋮비씨ㅏ⋮씨디ㅏ⋮ㅏ디씨⋮디비ㅏ⋮ㅏㅏ−⋮비씨−⋮ㅏ⎞⎠⎟⎟⎟⎟와이=(ㅏ씨디디비ㅏ씨비ㅏㅏ씨ㅏ−−⋮⋮⋮⋮⋮⋮⋮비씨ㅏ디ㅏ비ㅏ)Y=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&- &-\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & A\\ \end{array}\right) 편집 : 관찰 시퀀스 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.