통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
Mann-Whitney U-test : 효과 크기에 대한 신뢰 구간
Fritz, Morris, Richler (2011; 아래 참조)에 따르면 은 공식 r = z를 사용하여 Mann-Whitney U- 검정의 효과 크기로 계산할 수 있습니다. rrr 다른 경우에도r을 보고하기 때문에 이것은 나에게 편리합니다. 효과 크기 측정 값 외에도r의 신뢰 구간을보고하고 싶습니다.r=zN−−√r=zN r = \frac{z}{\sqrt N} rrrrrr 내 질문 은 다음과 같습니다 . 비모수 검정의 …

1
R : 선형 모형 잔차의 정규성을 테스트-사용할 잔차
정규성을 확인하기 위해 선형 모형의 잔차에 대해 Shapiro Wilk의 W 검정 및 Kolmogorov-Smirnov 검정을 수행하고 싶습니다. 원시 잔차, Pearson 잔차, 학생 잔차 또는 표준화 잔차에 대해 어떤 잔차를 사용해야하는지 궁금합니다. Shapiro-Wilk의 W 테스트의 경우 원시 및 Pearson 잔차에 대한 결과는 동일하지만 다른 결과는 그렇지 않은 것으로 보입니다. fit=lm(mpg ~ 1 …

5
학생 서류 채점에서 다른 수준의 관대함을 가진 마커의 효과를 어떻게 가장 잘 다룰 수 있습니까?
600 명 정도의 학생들이 광범위한 평가에서 점수를 받았는데, 이는 신뢰성 / 유효성이 양호하다고 가정 할 수 있습니다. 평가는 100 점 만점에 달하며 컴퓨터가 표시하는 객관식 시험입니다. 이 600 명의 학생들은 또한 2 차 사소한 평가 점수를받습니다. 이 두 번째 평가에서는 11 개의 다른 그레이더로 11 개의 코호트로 구분되며, 마킹에서 '유전성'측면에서 …

1
관측치가 독립적이지 않은 경우 잘못된 추론
나는 기본적인 선형 모델에서 추론이 유효하기 위해서는 관측이 독립적이어야한다는 기초 통계에서 배웠다. 클러스터링이 발생하면이를 고려하지 않는 한 더 이상 독립성이 더 이상 유효하지 않은 추론으로 이어질 수 없습니다. 이러한 클러스터링을 설명하는 한 가지 방법은 혼합 모델을 사용하는 것입니다. 시뮬레이션 여부에 관계없이 예제 데이터 세트를 찾고 싶습니다. 클러스터 된 데이터를 분석하기 …

2
일관되지 않은 최대 우도 추정기의 예
논문에 대한 의견을 읽었으며 저자는 때로는 추정기 (ML 또는 최대 유사 가능성으로 찾은 추정기)가 일관성이 없지만 가능성 비율 또는 유사 가능성 비율 검정의 힘이 여전히 수렴 할 수 있다고 말합니다. 관찰 된 데이터의 수가 무한대 인 경향이 있기 때문에 1 (테스트 일관성). 어떻게 그리고 언제 이런 일이 발생합니까? 참고 문헌에 …

2
캐럿 패키지를 사용하면 특정 임계 값에 대한 혼동 행렬을 얻을 수 있습니까?
train이항 반응에 대한 로지스틱 회귀 모델 (via )을 얻었으며 confusionMatrixin에서 로지스틱 혼동 행렬을 얻었 습니다 caret. 물류 모델 혼동 행렬을 제공하지만 어떤 임계 값을 얻는 데 사용되는지 확실하지 않습니다. confusionMatrix에서를 사용하여 특정 임계 값에 대한 혼동 행렬을 얻으려면 어떻게해야 caret합니까?


1
분포가 전력 법을 따르는 지 테스트하는 방법?
몇 명의 사용자가 몇 개의 질문을 게시하는지에 대한 데이터가 있습니다. 예를 들어 [UserCount, QuestionCount] [2, 100] [9, 10] [3, 80] ... ... 이는 2 명의 사용자가 각각 100 개의 질문을 게시하고 9 명의 사용자가 각각 10 개의 질문을 게시하는 등을 의미합니다. 그렇다면 UserCount, QuestionCount분포가 전력 법을 따르는 지 어떻게 알 …

4
교차 검증은 데이터 스누핑과 어떻게 다릅니 까?
방금 "통계 학습 소개"를 마쳤습니다 . 교차 검증을 사용하여 다양한 머신 러닝 기술에 대한 최상의 튜닝 매개 변수를 찾는 것이 데이터 스누핑과 다른지 궁금합니다. 튜닝 세트의 어떤 값이 테스트 세트에서 최상의 예측 결과를 가져 오는지를 반복해서 점검하고 있습니다. 우리가 도달 한 튜닝 매개 변수가 우연히이 특정 테스트 세트에 맞고 향후 …

2
회귀를 피팅 할 때 직교 다항식을 사용하지 않는 이유가 있습니까?
일반적으로 고차 변수로 회귀를 피팅 할 때 직교 다항식을 사용하지 않는 것이 더 좋은지 궁금합니다. 특히 R을 사용하는 것이 궁금합니다. 만약 poly()에 raw = FALSE같은 장착 값을 생성 poly()과 raw = TRUE, 그리고 poly함께 raw = FALSE해결할 수있는 문제 다항식 회귀와 관련된 문제 중 일부는 다음해야 poly()와 raw = FALSE …

1
R의 lm ()이 교과서와 다른 계수 추정치를 반환하는 이유는 무엇입니까?
배경 모델 피팅에 대한 과정에서 첫 번째 예 를 이해하려고합니다 (따라서 간단하게 보일 수 있습니다). 손으로 계산을 수행했으며 예제와 일치하지만 R에서 반복하면 모델 계수가 해제됩니다. 차이점은 모집단 분산 ( )을 사용하는 교과서 때문일 수 있다고 생각 했지만 R은 샘플 분산 ( )을 사용하고있을 수 있지만 계산에서 사용되는 위치를 볼 수는 …
13 r  regression  self-study  lm 

2
닫힌 간격으로 모든 합리적인 값을 취하는 이산 균일 랜덤 변수 (?)
방금 (지적) 공황 발작을 일으켰습니다. 닫힌 간격 에서 균일하게 따르는 연속 랜덤 변수 : 편안하게 친숙한 통계 개념. 유( a , b )U(a,b)U(a,b) 확장 된 실수 (반 또는 전체)를 지원하는 연속적인 균일 한 rv : rv는 적절하지 않지만 부적절한 이전, 유용하고 적용 가능한 기본 베이지안 개념. 한정된 수의 값을 취하는 …

3
부분 최소 제곱 (PLS) 회귀의 모형 가정
PLS 회귀 가정 (단일 ) 에 관한 정보를 찾으려고합니다 . 특히 OLS 회귀의 가정과 관련하여 PLS의 가정을 비교하는 데 관심이 있습니다. yyy 나는 PLS의 주제에 관한 많은 문헌을 읽거나 훑어 보았다. Wold (Svante and Herman), Abdi 등의 논문이 있지만 만족스러운 자료를 찾지 못했습니다. Wold et al. (2001) PLS- 회귀 : …

2
데이터를 대치하거나 주변 데이터를 찾는 데 인접 정보 사용 (R)
가장 가까운 이웃이 가장 좋은 예측 변수라는 가정하에 데이터 세트가 있습니다. 양방향 그래디언트의 완벽한 예 값이 거의없는 경우가 있다고 가정하고 이웃과 추세를 기반으로 쉽게 예측할 수 있습니다. R의 해당 데이터 매트릭스 (운동의 더미 예) : miss.mat <- matrix (c(5:11, 6:10, NA,12, 7:13, 8:14, 9:12, NA, 14:15, 10:16),ncol=7, byrow = TRUE) …

1
코시 분포에서 위치 모수의 MLE
중심을 설정 한 후 두 측정 x 및 -x 는 확률 밀도 함수를 사용하여 Cauchy 분포에서 독립적으로 관측 한 것으로 가정 할 수 있습니다. 1에프( x : θ ) =f(x:θ)=f(x :\theta) = ,−∞&lt;x&lt;∞1π( 1 + ( x − θ )2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) , - ∞ &lt; X &lt; ∞,−∞&lt;x&lt;∞, -∞ < …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.