통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
불균형이 심한 환경에서 비용에 민감한 학습을위한 제안
몇 백만 행과 ~ 100 열의 데이터 집합이 있습니다. 공통 클래스에 속하는 데이터 세트의 예제 중 약 1 %를 감지하고 싶습니다. 최소 정밀도 제약이 있지만 매우 비대칭 적 인 비용으로 인해 특정 리콜에 너무 열중하지 않습니다 (10 개의 긍정적 인 일치가 남지 않는 한)! 이 설정에서 권장 할 몇 가지 …

1
자식 노드의 Gini 감소 및 Gini 불순물
임의 포리스트에 대한 Gini 기능 중요도 측정 작업을하고 있습니다. 따라서 노드 불순물의 Gini 감소를 계산해야합니다. 여기 내가 그렇게하는 방법이 있는데, 그것은 정의와 충돌을 일으키고 어딘가에 잘못해야한다고 제안합니다 ... :) 이진 트리의 경우 왼쪽 및 오른쪽 자식의 확률을 고려하여 노드 의 Gini 불순물을 계산할 수 있습니다 nnn. i(n)=1−p2l−p2ri(n)=1−pl2−pr2 i(n) = 1 …

6
편광 된 사용자 의견을 탐지하는 방법 (높은 등급과 낮은 등급)
사용자가 제품 또는 항목에 대한 선호도를 표현할 수있는 별표 등급 시스템을 사용하는 경우 투표가 "분할"된 경우 통계를 어떻게 감지 할 수 있습니까? 의미는, 주어진 제품에 대해 평균이 5/3 인 경우에도 데이터 만 사용하여 1-5 분할 대 합의 3인지 여부를 어떻게 알 수 있습니까 (그래픽 방법 없음)

2
릿지 회귀 – 베이지안 해석
능선 회귀는 사전이 적절하게 선택된 경우 사후 분포의 평균으로 도출 될 수 있다고 들었습니다. 이전의 회귀 계수에 설정된 제약 (예 : 0 주위의 표준 정규 분포)이 동일하고 계수의 제곱 크기에 설정된 페널티를 대체한다는 직감이 있습니까? 이 동등성을 유지하려면 이전이 가우시안이어야합니까?

1
분산을 설명한다는 것은 무엇을 의미합니까?
특히, 왜 우리가 다중 R 개념 (다중 회귀 분석에서 관측 점수와 예측 점수 사이의 상관 관계로 이해할 수 있음)을 갖는지 궁금한 다음 별도의 개념 R- 제곱 인 정사각형 또는 R입니다. R- 제곱은 설명 된 백분율 변동이며 R은 그렇지 않다는 것을 알았지 만 상관 관계와 설명 된 변동 사이의 차이점을 이해하지 …

3
불균형 데이터를위한 SVM
데이터 세트에서 SVM (Support Vector Machine)을 사용하려고합니다. 그래도 문제를 시도하기 전에 SVM이 불균형이 심한 데이터에서 제대로 작동하지 않는다는 경고를 받았습니다. 제 경우에는 최대 95-98 % 0과 2-5 % 1을 가질 수 있습니다. 스파 스 / 언밸런스 드 데이터에서 SVM 사용에 대해 이야기 한 리소스를 찾으려고했지만 'sparseSVM'(소량의 지원 벡터를 사용) 만 …

2
R에서 "손으로"AIC 계산
R에서 선형 회귀의 AIC를 계산하려고 시도했지만 다음 AIC과 같이 함수 를 사용하지 않았습니다 . lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 그러나 AIC다른 값을 제공합니다. AIC(lm_mtcars) [1] 190.7999 누군가 내가 뭘 잘못하고 있는지 말해 줄래?

4
데이터를 변환 할 때 피해야 할 위험은 무엇입니까?
응답을 이중으로 변환 한 후 XXX 와 YYY 변수 사이에 강한 선형 관계를 얻었습니다 . 모델은 Y∼XY∼XY\sim X 이지만 √로 변환했습니다. R2를 .19에서 .76으로YX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X} 개선하는 X.R2R2R^2 분명히 나는이 관계에 대해 괜찮은 수술을했다. 과도한 변환의 위험 또는 통계적 원칙 위반 가능성과 같이이 작업의 함정에 대해 토론 할 수있는 사람이 있습니까?

3
왜 베이지안 다항식 Naive Bayes 분류기를 사용하지 않는 이유는 무엇입니까?
따라서 (감독되지 않은) 텍스트 모델링에서 Latent Dirichlet Allocation (LDA)은 베이지안 버전의 확률 적 잠재 성 의미 분석 (PLSA)입니다. 기본적으로 LDA = PLSA + Dirichlet는 매개 변수보다 우선합니다. LDA는 이제 참조 알고리즘이며 다양한 패키지로 구현되는 반면 PLSA는 더 이상 사용해서는 안됩니다. 그러나 (감독 된) 텍스트 분류에서 다항식 Naive Bayes 분류기에 대해 …

2
샘플링 분포는 추론에 합법적인가?
일부 베이지안들은 연구자의 의도에 따라 "독특한 샘플링 분포가 없다"는 잦은 추론을 공격한다 (Kruschke, Aguinis, & Joo, 2012, p. 733). 예를 들어 한 연구원이 데이터 수집을 시작했지만 40 명이 참여한 후 그의 자금이 예기치 않게 삭감되었다고 가정 해 보겠습니다. 샘플링 분포 (및 후속 CI 및 p- 값)는 어떻게 여기에서도 정의됩니까? 각 …

1
엄격하게 긍정적 인 예측을 달성하는 방법?
나는 값이 엄격하게 양수인 시계열을 연구하고 있습니다. AR, MA, ARMA 등의 다양한 모델을 사용하여 긍정적 인 예측을 얻는 쉬운 방법을 찾을 수 없었습니다. 나는 예측을 위해 R 을 사용 하고 있으며 내가 찾을 수있는 모든 것은 여기에 설명 된 긍정적 인 매개 변수 가있는 predict.hts {hts}입니다 . 계층 적 또는 …


2
손으로 ARIMA 추정
ARIMA 모델링 / Box Jenkins (BJ)에서 매개 변수가 어떻게 추정되는지 이해하려고합니다. 불행히도 내가 만난 책 중 어느 것도 Log-Likelihood 추정 절차와 같은 추정 절차를 자세하게 설명하지 않습니다. 매우 유용한 웹 사이트 / 교육 자료 를 찾았습니다 . 다음은 위에서 언급 한 소스의 방정식입니다. L L ( θ ) = − …

1
귀무 가설 하에서 교환 가능한 샘플의 직관은 무엇입니까?
순열 검정 (랜덤 화 검정, 재 랜덤 화 검정 또는 정확한 검정이라고도 함)은 매우 유용하며, 예를 들어 요구되는 정규 분포 가정이 t-test충족되지 않고 순위에 따라 값을 변환 할 때 유용합니다. 비모수 테스트 Mann-Whitney-U-test는 더 많은 정보가 손실 될 수 있습니다. 그러나 이러한 종류의 테스트를 사용할 때 단 하나의 가정 만 …
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

4
변환 할 때 비정규 데이터를 유지하는 비정규 데이터에 대해 회귀를 수행하려면 어떻게해야합니까?
21 개 설문지 항목에 대한 리 커트 척도 답변에서 파생 된 일부 데이터 (158 건)가 있습니다. 설문지의 어떤 항목이 전체 항목에 대한 응답을 예측하는지 확인하기 위해 회귀 분석을 수행하고 싶습니다 (만족도). 응답은 (KS 테스트에 따라) 정상적으로 배포되지 않으며 내가 생각할 수있는 모든 방식 (역, 로그, log10, sqrt, 제곱)으로 변환했으며 정규 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.