통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
다중 대치 된 데이터 세트에서 부트 스트랩 된 p- 값을 풀링하려면 어떻게해야합니까?
MI (multiply imputed) 데이터로부터 의 추정치에 대해 p- 값을 부트 스트랩하고 싶지만 MI 세트에서 p- 값을 결합하는 방법이 확실하지 않다는 문제가 우려됩니다.θθ\theta MI 데이터 세트의 경우 추정치의 총 분산에 도달하는 표준 접근법은 Rubin의 규칙을 사용합니다. 풀링 MI 데이터 세트에 대한 검토는 여기 를 참조 하십시오 . 총 분산의 제곱근은 표준 …

2
원시 데이터에 대해 회귀와 같은 모델 가정을 테스트하고 나머지에 대해 다른 사람들이 테스트하는 이유는 무엇입니까?
저는 실험 심리학 박사 과정 학생이며 데이터 분석 방법에 대한 기술과 지식을 향상시키기 위해 열심히 노력합니다. 심리학에서 5 년째까지 회귀 형 모델 (예 : 분산 분석)은 다음과 같은 사항을 가정한다고 생각했습니다. 데이터의 정규성 데이터에 대한 분산 동질성 학부 과정에서 데이터에 대한 가정이 있다고 믿게되었습니다. 그러나 5 학년 때, 일부 강사들은 …

5
용어 빈도 / 역 문서 빈도 (TF / IDF) : 가중치
1000 개의 문서와 그 안에 나타나는 모든 단어를 나타내는 데이터 세트가 있습니다. 따라서 행은 문서를 나타내고 열은 단어를 나타냅니다. 그래서 예를 들어, 셀의 값은 시간을 나타내며, 워드 문서 발생 . 이제 tf / idf 방법을 사용하여 단어의 '무게'를 찾아야하지만 실제로이 작업을 수행하는 방법을 모르겠습니다. 누군가 나를 도울 수 있습니까?j i(i,j)(i,j)(i,j)jjjiii

5
존 커 리치 코인 플립 데이터
2 차 세계 대전 동안 존 커리 히 (John Kerrich)가 수행 한 10,000 개의 동전 뒤집기 (즉, 10,000 개의 머리와 꼬리 모두) 결과를 얻을 수있는 곳을 제안 할 수있는 사람이 있습니까?


4
R에서 ROC 아래 영역의 p- 값을 계산하는 방법
ROC (receiver operator 특성)에 따라 영역의 p- 값을 계산하는 방법을 찾기 위해 고심하고 있습니다. 연속 변수와 진단 테스트 결과가 있습니다. AUROC가 통계적으로 유의한지 확인하고 싶습니다. pROC, ROCR, caTools, 검증, Epi와 같은 ROC 곡선을 다루는 많은 패키지를 발견했습니다. 그러나 문서와 테스트를 읽는 데 몇 시간을 보낸 후에도 방법을 찾을 수 없었습니다. …
12 r  p-value  roc 

4
매우 큰 표본 크기에 적합한 적합도
나는 매일 매우 큰 범주 형 데이터의 표본 (> 1,000,000)을 수집하고 데이터 수집에서 오류를 감지하기 위해 데이터가 날마다 "상당히"다르게 보이기를 원합니다. 나는 적합 테스트 (특히 G 테스트)를 사용하는 것이 이것에 적합하다고 생각했습니다. 예상 분포는 전날의 분포로 제공됩니다. 그러나 샘플 크기가 너무 크기 때문에 검정의 검정력이 매우 높고 많은 오 탐지가 …

4
표준 편차를 증가시키는 가치
나는 다음 진술에 당황했다. "숫자 집합의 표준 편차를 증가 시키려면 평균에서 두 개 이상의 표준 편차 인 값을 추가해야합니다." 그 증거 는 무엇입니까 ? 물론 표준 편차를 정의하는 방법을 알고 있지만 그 부분은 어떻게 든 그리워합니다. 다른하실 말씀 있나요?

2
집계시 어떤 통계가 유지됩니까?
노이즈가 많은 길고 높은 해상도의 시계열이있는 경우 데이터를 더 낮은 해상도 (예 : 매일부터 월 단위로)로 집계하여 진행 상황을 더 잘 이해하고 일부를 효과적으로 제거하는 것이 좋습니다. 소음. 별도의 변수에 대한 선형 회귀 분석에 대한 를 포함하여 집계 된 데이터에 일부 통계를 적용하는 논문이 하나 이상 있습니다. 유효합니까? 노이즈 감소로 …

1
“통합의 평균”보다 더 나은 이름이 있습니까?
비즈니스에서 판매하는 스로틀 위치 센서 (TPS)를 테스트하고 있으며 스로틀 샤프트의 회전에 대한 전압 응답 플롯을 인쇄합니다. TPS는 회전 센서입니다.≈≈\approx90 °의 범위 및 출력은 완전 개방이 5V (또는 센서의 입력 값)이고 초기 개방이 0에서 0.5V 사이의 일부 값인 전위차계와 같습니다. 0.75 °마다 전압을 측정하기 위해 PIC32 컨트롤러 로 테스트 벤치를 구축 …

1
다중 공선 성 및 스플라인 회귀에 문제가 있습니까?
자연적인 (즉, 제한된) 큐빅 스플라인을 사용할 때 생성 된 기본 함수는 매우 공 선형이며 회귀에 사용될 때 다중 공선 성을 나타내는 매우 높은 VIF (분산 인플레이션 계수) 통계를 생성하는 것으로 보입니다. 예측 목적으로 모델의 경우를 고려할 때 이것이 문제입니까? 스플라인 구조의 특성으로 인해 항상 그렇습니다. 다음은 R의 예입니다. library(caret) library(Hmisc) …

1
혼합 효과 모델에서 고정 효과에 대한 추론
데이터를 서로 연관 시켰으며 로지스틱 회귀 혼합 효과 모델을 사용하여 관심있는 예측 변수에 대한 개별 수준 (조건부) 효과를 추정합니다. 표준 한계 모델의 경우 Wald 검정을 사용한 모형 모수에 대한 추론이 우도 비율 및 점수 검정과 일치한다는 것을 알고 있습니다. 그들은 일반적으로 거의 동일합니다. Wald는 계산하기 쉽고 R 출력으로 제공되므로 99 …

1
엄격한 폰 노이만 불평등의 예
하자 추정기의 베이 즈 위험 나타낸다 종래에 대해 \ 파이 ,하자 \ 파이는 상기 파라미터 공간의 모든 전과 세트 나타낸다 \ 쎄타 및하자 \ 델타 들의 세트를 나타낸다 모든 (아마도 무작위 화 된) 결정 규칙.r(π,δ)r(π,δ)r(\pi, \delta)δδ\deltaππ\piΠΠ\PiΘΘ\ThetaΔΔ\Delta John von Neumann의 최소 최대 불평등에 대한 통계적 해석은 supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ),supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ), \sup_{\pi\in\Pi} \inf_{\delta\in\Delta} r(\pi, \delta) …

2
중첩되지 않은 모델에 우도 비율 테스트를 사용할 수없는 이유는 무엇입니까?
더 구체적으로, 모형이 중첩 된 경우 우도 비 검정이 무의식적으로 분포를 갖는 이유는 무엇입니까?하지만 더 이상 중첩되지 않은 모형의 경우에는 해당되지 않습니까? 나는 이것이 윌크스 정리에 따른다는 것을 이해하지만, 불행히도 나는 그 증거를 이해하지 못한다 .χ2χ2\chi^2

1
lmer와 p- 값에 대한 혼란 : memisc 패키지의 p- 값과 MCMC의 p- 값은 어떻게 비교됩니까?
패키지 의 함수 lmer()가 lme4p- 값을 생성하지 않았다는 인상을 받았습니다 ( lmerp- 값 및 그 밖의 모든 것을 참조하십시오 ). 이 질문에 따라 대신 MCMC에서 생성 된 p 값을 사용 했습니다. lme4혼합 모델의 중요한 효과 및이 질문 : 의 패키지에서 출력에서 p- 값을 찾을 수 없습니다lmer()lm4R . 최근에 memisc 라는 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.