통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
지난 달 레코드를 기반으로 판매를 예측하기위한 적절한 시계열 모델 개발
지금 2 년 동안 온라인 비즈니스를 운영해 왔으므로 약 2 년 동안 월별 판매 데이터를 보유하고 있습니다. 매월 저의 사업은 계절 변동 (크리스마스 등에서 더 나은 실적)과 내가 모르는 다른 요인에 의해 영향을받습니다. 향후 판매를 더 잘 예측하고 내 판매 캠페인의 효과 또는 새로운 경쟁 업체의 영향을 측정하기 위해 현재 …

2
주요 구성 요소의 수를 판별하기 위해 PCA에 대한 교차 유효성 검증을 수행하는 방법은 무엇입니까?
주요 구성 요소 분석, PCA에 대한 자체 함수를 작성하려고합니다 (물론 이미 많이 작성되었지만 직접 구현하는 데 관심이 있습니다). 내가 만난 주요 문제는 교차 검증 단계와 예측 제곱합 (PRESS)을 계산하는 것입니다. 어떤 교차 유효성 검사를 사용하든 중요하지 않은 이론에 대한 질문이지만 LOOCV (Leave-One-Out Cross-Validation)를 고려하십시오. LOOCV를 수행하려면 다음과 같은 이론이 필요하다는 …


2
MCMC 방법-샘플 굽기?
에서 MCMC의 방법, 나는에 대해 계속 읽기 burn-in시간이나, 샘플의 수 "burn". 이것이 정확히 무엇이며 왜 필요한가요? 최신 정보: MCMC가 안정화되면 안정적으로 유지됩니까? burn-in시간 의 개념 은 혼합 시간 의 개념과 어떤 관련이 있습니까?
12 sampling  mcmc 

4
거리 매트릭스만으로 PCA 수행
페어 단위 거리 만있는 거대한 데이터 세트를 클러스터하고 싶습니다. k-medoids 알고리즘을 구현했지만 실행하는 데 시간이 너무 오래 걸리므로 PCA를 적용하여 문제의 차원을 줄이는 것으로 시작하고 싶습니다. 그러나이 방법을 수행하는 유일한 방법은 내 상황에없는 공분산 행렬을 사용하는 것입니다. 쌍별 거리 만 알고 PCA를 적용 할 수있는 방법이 있습니까?


2
'Tidy 데이터'작성을위한 우수 사례
Hadley Wickham은 작년 JSS에서 데이터 조작 및 분석을 수행하기 위해 데이터를 "최적의"조건으로 만드는 방법에 대한 "Tidy Data"( link ) 라는 훌륭한 기사를 작성했습니다 . 그러나 작업 환경에서 표 형식 데이터를 표시하는 데있어 모범 사례가 무엇인지 궁금했습니다. 동료가 데이터를 제공하도록 요청한다고 가정 해 보겠습니다. 해당 데이터를 구성 할 때 사용하는 일반적인 …
12 dataset  tables 

3
포아송 분포에 대한 정규 근사
Wikipedia에서는 다음 과 같이 말합니다. 충분히 큰 λλλ 값 (예 : λ>1000λ>1000λ>1000 )의 경우 평균 λλλ 및 분산 λλλ (표준 편차 λ−−√λ\sqrt{\lambda} ) 의 정규 분포 는 포아송 분포에 대한 근사치입니다. 경우 λλλ 약 10보다 큰 적절한 연속성 보정, 즉, 실행되는 경우, 정규 분포는 양호한 근사치 인 P(X≤x),P(X≤x),P(X ≤ x), …

1
중요도 샘플링의 직관적 인 예
저의 배경은 컴퓨터 과학입니다. 나는 몬테 카를로 샘플링 방법에 익숙하지 않으며 수학을 이해하지만 중요도 샘플링에 대한 직관적 인 예를 제시하기가 어렵습니다. 보다 정확하게는 누군가 다음과 같은 예를 제공 할 수 있습니다. 최초 분포는 표본 추출이 불가능하지만 추정 할 수는 있음 이 최초 배포본에서 추출하여 적절한 중요도 분포.

1
Fisher의 정확한 테스트 및 초기 하 분포
피셔의 정확한 테스트를 더 잘 이해하고 싶기 때문에 f와 m이 남성과 여성에 해당하고 n과 y가 "소다 소비"에 해당하는 다음 장난감 예제를 고안했습니다. > soda_gender f m n 0 5 y 5 0 분명히 이것은 과감한 단순화이지만 컨텍스트가 방해되는 것을 원하지 않았습니다. 여기서 나는 남자들이 음료수를 마시지 않고 여자들은 음료수를 마시고 …

2
토마스 베이 즈가 왜 베이 즈의 정리가 그렇게 도전적인가?
이것은 과학적 질문의 역사에 관한 것이지만 여기서 주제가 되길 바랍니다. 나는 토마스 베이 즈 (Thomas Bayes)가 이전의 유니폼의 특별한 경우에 대한 베이 즈 정리를 발견 할 수 있었으며, 심지어 그는 그것과도 싸웠다 고 읽었습니다. 일반 베이 즈 정리가 현대 치료에 얼마나 사소한지를 고려할 때, 왜 베이 즈와 다른 수학자들에게 왜 …

1
캐럿 패키지와 함께 RandomForest의 FinalModel을 사용하여 예측 전에 사전 처리가 필요합니까?
10x10CV로 randomForest 객체를 훈련하기 위해 캐럿 패키지를 사용합니다. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) 그 후, testSet (새 데이터)에서 randomForest를 테스트합니다. RF.testSet$Prediction <- predict(RFFit, newdata=testSet) 혼란 매트릭스는 모델이 그렇게 나쁘지 않다는 것을 보여줍니다. confusionMatrix(data=RF.testSet$Prediction, RF.testSet$Defect) Reference Prediction 0 1 …

3
AIC를 최소화하여 모델을 선택하는 것이 언제 적절한가요?
적어도 일부 상위 칼리버의 통계 학자들 사이에서, 최소값의 특정 임계 값 내에 AIC 통계치가있는 모델은 AIC 통계를 최소화하는 모델로서 적절하게 고려되어야한다는 것이 잘 확립되어있다. 예를 들어 [1, p.221]에서 그런 다음 작은 GCV 또는 AIC 모델이 가장 좋습니다. 물론 GCV 또는 AIC를 맹목적으로 최소화해서는 안됩니다. 오히려 합리적으로 작은 GCV 또는 AIC …

2
'부분적'및 '마진 적'상관 관계의 이름에 대한 직관
왜 두 변수 사이의 조건부 상관을 "부분"상관이라고하고 그 사이의 간단한 상관 관계 (다른 변수에 조건이없는 경우)를 "마진"상관이라고 생각하는 사람이 있습니까? "부분"과 "여백"이라는 단어의 직관은 무엇입니까? "부품"또는 "여백"으로 무엇을합니까? 이러한 개념을 더 잘 이해하려면 답을 배우는 것이 좋습니다.


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.