통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
R에 여러 외생 변수가있는 Arima 시계열 예측 (auto.arima)
여러 외생 변수가있는 여러 시계열 ARIMA 모델을 기반으로 예측을 수행하고 싶습니다. 통계 나 RI가 유지하고 싶지 않은 기술에 대해서는 그다지 간단하지 않기 때문에 (3 개월 동안의 예측은 충분합니다). 나는 1 개의 종속 시계열과 3-5 개의 예측 변수 시계열, 모든 월간 데이터, 간격이없고 같은 시간 "수평선"이 있습니다. auto.arima 함수가 발생하여 이것이 …
14 r  time-series  arima 

1
릿지 회귀는 왜 다중 공선 성이있는 상태에서 잘 작동합니까?
능선 회귀에 대해 배우고 있으며 능선 회귀가 다중 공선 성이 존재할 때 더 잘 작동하는 경향이 있음을 알고 있습니다. 왜 이것이 사실인지 궁금합니다. 직관적 인 답변이나 수학적인 답변이 만족할 것입니다 (두 가지 유형의 답변 모두 더 만족할 것입니다). 또한, 나는 그 것을 알고 β가 항상 얻을 수 있지만, 얼마나 정확한 …

4
데이터가 왜곡 될 때 평균을 사용해야합니까?
종종 입문 적용된 통계 텍스트는 평균이 평균과 구별됩니다 (종종 설명 통계의 맥락에서 평균이 평균, 중간 값 및 모드를 사용하여 중심 경향의 요약을 유발 함). 평균이 샘플 데이터 및 / 또는 인구 분포를 왜곡하여 데이터가 대칭이 아닌 경우 중앙값이 선호된다는 주장의 근거로 사용됩니다. 예를 들면 다음과 같습니다. 주어진 데이터 세트에 대한 …


3
로지스틱 회귀 분석의 절편
다음과 같은 로지스틱 회귀 모델이 있다고 가정합니다. 로짓 ( p ) = β0+ β1엑스1+ β2엑스2logit(p)=β0+β1x1+β2x2\text{logit}(p) = \beta_0+\beta_{1}x_{1} + \beta_{2}x_{2} 가요 이벤트 확률 때 X (1) = 0 및 X 2 = 0 ? 다시 말해서, x 1 과 x 2 가 가장 낮은 레벨 일 때 (이것이 0이 아니더라도) 이벤트 …


5
평활화 된 데이터에서 R의 변곡점 찾기
부드럽게 사용하는 데이터가 loess있습니다. 부드러운 선의 변곡점을 찾고 싶습니다. 이것이 가능한가? 누군가 가이 문제를 해결하기 위해 멋진 방법을 만들었을 것입니다 ... 내 말은 ... 결국 R입니다! 사용하는 스무딩 기능을 변경해도 괜찮습니다. 나는 loess그것이 과거에 사용 되었던 것이기 때문에 사용했습니다. 그러나 모든 평활 기능은 좋습니다. 변곡점이 사용하는 스무딩 기능에 따라 달라집니다. …
14 r  smoothing  loess 

3
PCA에서 얻은 내용을 어떻게 해석 할 수 있습니까?
대학 배정의 일환으로 상당히 큰 다변량 (> 10) 원시 데이터 세트에서 데이터 사전 처리를 수행해야합니다. 나는 어떤 의미에서 통계학자가 아니므로, 무슨 일이 일어나고 있는지에 대해 약간 혼란스러워합니다. 아마도 재미 있고 간단한 질문이 무엇인지 사전에 사과합니다. 다양한 답변을보고 통계에 대해 이야기 한 후 머리가 돌고 있습니다. 나는 그것을 읽었다 : PCA를 …
14 pca 

4
ROC 및 multiROC 분석 : 최적의 컷 포인트 계산 방법
ROC 곡선에 대한 최적의 컷 포인트를 계산하는 방법을 이해하려고합니다 (감도 및 특이성이 최대화되는 값). aSAH패키지 의 데이터 세트 를 사용하고 pROC있습니다. outcome변수는 두 개의 독립 변수에 의해 설명 될 수있다 : s100b및 ndka. Epi패키지 의 구문을 사용하여 두 가지 모델을 만들었습니다. library(pROC) library(Epi) ROC(form=outcome~s100b, data=aSAH) ROC(form=outcome~ndka, data=aSAH) 출력은 다음 두 …

3
kmeans를 실행하기 전에 상관 관계 / 공 선형 변수를 삭제해야합니까?
고객의 클러스터를 식별하기 위해 kmeans를 실행하고 있습니다. 클러스터를 식별하는 약 100 개의 변수가 있습니다. 이러한 각 변수는 고객이 카테고리에서 지출 한 비율을 나타냅니다. 따라서 100 개의 카테고리가있는 경우 각 고객에 대해이 변수의 합이 100 %가되도록 100 개의 변수를 갖습니다. 이제이 변수들은 서로 밀접하게 연관되어 있습니다. kmeans를 실행하기 전에 공선 성을 …

2
다중 선형 회귀 시뮬레이션
저는 R 언어를 처음 사용합니다. 회귀에 대한 네 가지 가정을 모두 충족시키는 다중 선형 회귀 모델에서 시뮬레이션하는 방법을 알고 싶습니다. 알았어. 고마워 이 데이터 세트를 기반으로 데이터를 시뮬레이션하고 싶다고합시다. y<-c(18.73,14.52,17.43,14.54,13.44,24.39,13.34,22.71,12.68,19.32,30.16,27.09,25.40,26.05,33.49,35.62,26.07,36.78,34.95,43.67) x1<-c(610,950,720,840,980,530,680,540,890,730,670,770,880,1000,760,590,910,650,810,500) x2<-c(1,1,3,2,1,1,3,3,2,2,1,3,3,2,2,2,3,3,1,2) fit<-lm(y~x1+x2) summary(fit) 그런 다음 출력을 얻습니다. Call: lm(formula = y ~ x1 + x2) Residuals: Min 1Q Median …

2
감마 분포와 함께 GLM에 R 사용
현재 감마 분포를 사용하여 GLM을 피팅하기위한 R의 구문을 이해하는 데 문제가 있습니다. 각 행에 3 개의 공변량 ( ), 응답 변수 ( ) 및 모양 매개 변수 ( ) 가 포함 된 일련의 데이터가 있습니다 . 3 개의 공변량의 선형 함수로 감마 분포의 스케일을 모델링하고 싶지만 각 데이터 행에 대해 …

3
선형 회귀를 수행하지만 솔루션이 특정 데이터 포인트를 통과하도록 강제
일련의 점에서 선형 회귀를 수행하는 방법을 알고 있습니다. 즉, 선택한 다항식을 주어진 데이터 세트 (LSE 의미)에 맞추는 방법을 알고 있습니다. 그러나 내가 모르는 것은 내 솔루션이 내가 선택한 특정 지점을 통과하도록하는 방법입니다. 나는 이것이 전에 행해지는 것을 보았지만, 그것이 어떻게 수행되었는지는 물론이고 절차가 무엇인지 기억할 수 없다. 매우 간단하고 구체적인 …

2
두 개의 종속 다변량 정규 확률 변수의 선형 조합
두 개의 랜덤 변수 벡터가 있는데, 둘 다 정상입니다. 즉, 및 입니다. 우리는 선형 조합 의 분포에 관심이 있습니다. 여기서 와 는 행렬이고 는 벡터입니다. 경우 및 독립적으로, . 우리는 모든 쌍 의 상관 관계를 알고 있다고 가정하면 의존적 인 경우 입니다. 감사합니다.X∼N(μX,ΣX)X∼N(μX,ΣX)X \sim N(\mu_X, \Sigma_X)Y∼N(μY,ΣY)Y∼N(μY,ΣY)Y \sim N(\mu_Y, \Sigma_Y)B C …

2
발생률 비율의 해석
그래서 저는 랜덤 효과 마이너스 이항 모형에 적합하고 싶습니다. 이러한 모델의 경우 STATA는 지수화 된 계수를 생성 할 수 있습니다. 도움말 파일에 따르면 이러한 계수는 발생률 비율로 해석 될 수 있습니다. 불행히도 나는 영어 원어민이 아니며 발생률 비율이 무엇인지 또는 어떻게 번역 할 수 있는지 이해하지 못합니다. 그래서 제 질문은, …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.