통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

6
앙상블 방법을 구현하는 방법을 배우기위한 리소스
이론적으로는 (어떻게) 작동하는지 이해하지만 실제로 앙상블 방법을 사용하는 방법 (투표, 가중 혼합물 등)을 잘 모르겠습니다. 앙상블 메소드를 구현하기위한 좋은 리소스는 무엇입니까? 파이썬 구현과 관련된 특정 리소스가 있습니까? 편집하다: 의견에 대한 토론을 기반으로 일부를 정리하기 위해 randomForest 등과 같은 앙상블 알고리즘을 찾고 있지 않습니다. 대신 다른 알고리즘의 다른 분류를 어떻게 결합 …

4
DoE에 대한 Fisher의 인용문을 실제로 보여주기
우리 팀과 저는 실험 설계의 유용성에 대해 회사의 비 통계 학자에게 프리젠 테이션을하고 싶습니다. 이러한 비 통계학 자도 고객이며 데이터를 수집하기 전에 Google에 문의하지 않습니다. 피셔의 유명한 인용문을 잘 설명 할 수있는 실제 사례를 알고 있습니까? "실험이 끝난 후 통계 학자에게 전화하는 것은 사후 검사를 요구하는 것 이상일 수 있습니다. …

2
큰 표본 크기에서 왜 혼란 문제를 다루기 어렵습니까?
점 가 있다고 가정 합니다. 각 점 는 분포 수득 후방 위해하려면 우리는 물품 Minka의 Expectation Propagation 논문에 따르면 사후 하려면 계산이 필요 하므로 큰 표본 크기 대한 문제를 다루기 어렵게됩니다 . 그러나 단일 때문에이 경우 왜 그런 계산량이 필요한지 알 수 없습니다.p ( x | y ) ∝ p …

1
베이지안 glm의
여기서 데이터에 베이지안 로짓을 실행하려고합니다 . R의 패키지에서 사용 bayesglm()하고 있습니다 arm. 코딩은 간단합니다. df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) 다음과 같은 출력을 제공합니다. Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 SEXMale 0.02408 0.09363 0.257 0.797 …
13 r  bayesian  p-value 

2
그룹화 된 쌍을 보여주는 표에서 Tukey HSD 사후 테스트 결과를 얻는 방법은 무엇입니까?
R과 함께 양방향 Anova 후 TukeyHSD 사후 테스트를 수행하여 중요한 차이로 그룹화 된 정렬 쌍을 포함하는 테이블을 얻고 싶습니다. (언어에 대해 미안하지만, 나는 여전히 통계에 익숙하지 않다.) 나는 이와 같은 것을 갖고 싶다 : 따라서 별이나 문자로 그룹화됩니다. 어떤 생각? 패키지 에서 함수 HSD.test()를 테스트 agricolae했지만 양방향 테이블을 처리하지 않는 …

1
R에서 glmnet을 사용한 예측
glmnetR 의 패키지를 사용하여 일부 데이터를 모델링하려고 합니다. 다음 데이터가 있다고 가정 해 봅시다. training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (이것은 단순화입니다. 데이터가 훨씬 더 복잡합니다.) 그런 다음 다음 코드를 사용하여 glmnet 모델을 …
13 r  glmnet 

4
데이터 세트의 랜덤 서브 샘플을 사용하여 K- 평균 센터를 초기화합니까?
특정 데이터 세트가있는 경우 해당 데이터 세트의 임의 샘플을 사용하여 클러스터 센터를 초기화하는 것이 얼마나 영리합니까? 예를 들어, 내가 원한다고 가정하십시오 5 clusters. 내가 가지고 5 random samples, 말의 size=20%원본 데이터 셋의. 그런 다음이 5 개의 임의 샘플 각각의 평균을 취하여 해당 평균을 5 개의 초기 클러스터 센터로 사용할 수 …

1
재미있는 통계 시험 답변 [폐쇄]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 칠년 전에 . 시험 교정은 아마도 교사의 가장 지루한 작업 일 것입니다. 그러나 재미있는 통계 시험 답변을 수집하는 것이 재미있을 수 있습니다. 답변 당 하나의 항목.
13 teaching  humor 


1
로지스틱 회귀 모수를 계산하기 위해 GMM (Generalized Method of Moments) 사용
나는 로지스틱 회귀 분석과 매우 유사하다 회귀 (다른 계수 사실 로지스틱 회귀 분석에 계수를 계산하려면 : 경우A는주어질 수있다). 계수를 계산하기 위해 GMM을 사용하려고 생각했지만 사용해야하는 모멘트 조건이 무엇인지 잘 모르겠습니다.ㅏ1 + 전자− ( b0+ b1엑스1+ b2엑스2+ … ),A1+e−(b0+b1x1+b2x2+…), \frac{A}{1 + e^{- (b_0 + b_1 x_1 + b_2 x_2 + \ldots)}},ㅏAA …


3
머신 러닝의 최신 개발을 추적 할 수있는 무료로 제공되는 유용한 저널은 무엇입니까?
다른 유용한 지식 포털을 '저널'로 자유롭게 대체하십시오. 실제 응용 프로그램을 고려하여 기계 학습의 새로운 개발에 주목하고 싶습니다. 나는 (이 분야에서는 그렇지 않은) 내 자신의 작품을 출판하려는 학문이 아니지만, 실용적 수준에서 유용 할 수있는 잠재적 인 새로운 알고리즘이나 트릭을 알고 싶습니다. 유일한주의 사항은 저널 / 컨퍼런스 진행 또는 구독없이 자유롭게 사용할 …

2
선형 회귀 경우에만 알고
라고 가정하십시오 Xβ=YXβ=YX\beta =Y. 우리는 모르는 YYY 정확히 각 예측, 만의 상관 관계 XtYXtYX^\mathrm{t}Y . 통상 최소 제곱 (OLS) 용액은 β=(XtX)−1XtYβ=(XtX)−1XtY\beta=(X^\mathrm{t} X)^{-1} X^\mathrm{t}Y 및 문제는 없다. 그러나 XtXXtXX^\mathrm{t}X 가 단수 (다중 공선 성)에 가깝고 최적의 능선 모수를 추정해야한다고 가정합니다. 모든 방법에는 정확한 값이 필요한 것 같습니다 YYY. 만 XtYXtYX^\mathrm{t}Y알려진 대안 …

6
랜덤 포레스트 : 테스트 세트에서 새로운 요소 수준을 처리하는 방법?
R의 임의 포리스트 모델을 사용하여 예측하려고합니다. 그러나 테스트 세트의 일부 요소가 훈련 세트와 다른 값을 가지므로 오류가 발생합니다. 예를 들어, 테스트 세트에는 학습 세트에 표시되지 않은 Cat_2값 34, 68, 76등 이 있습니다 . 불행히도, 테스트 세트를 제어 할 수 없습니다 ... 나는 그대로 사용해야합니다. 내 유일한 해결 방법은을 사용하여 문제가되는 …

3
근 평균 제곱 오차 및 평균 바이어스 편차에 대한 개념적 이해
RMSE (root Mean Squared Error) 및 MBD (Mean Bias Deviation)에 대한 개념적인 이해를 원합니다. 필자의 데이터 비교를 위해 이러한 측정 값을 계산 한 결과, RMSE가 높고 (예 : 100kg) MBD가 낮다는 (예 : 1 % 미만) 나는 종종 당황했습니다. 더 구체적으로, 나는 이러한 측정의 수학을 열거하고 논의하는 참조 (온라인이 아닌)를 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.