통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
XGBoost는 예측 단계에서 누락 된 데이터를 처리 할 수 ​​있습니다
최근에 XGBoost 알고리즘을 검토 한 결과이 알고리즘이 교육 단계에서 누락 된 데이터 (대치없이)를 처리 할 수 ​​있음을 알았습니다. XGboost가 새로운 관측치를 예측하는 데 사용되거나 누락 된 데이터를 대치해야 할 때 누락 된 데이터 (대치없이)를 처리 할 수 ​​있는지 궁금합니다. 미리 감사드립니다.

3
훈련 데이터보다 높지 않은 임의의 포리스트 회귀 분석
적어도에서에서 임의의 포리스트 회귀 모델을 작성할 때 R예측 값이 훈련 데이터에 표시된 대상 변수의 최대 값을 절대 초과하지 않는 것으로 나타났습니다. 예를 들어 아래 코드를 참조하십시오. 데이터를 mpg기반으로 예측하는 회귀 모델을 작성 중입니다 mtcars. 나는 OLS와 랜덤 포레스트 모델을 만들고 그것들을 사용하여 mpg연비가 좋은 가상 자동차 를 예측 합니다. OLS는 …
12 r  random-forest 

2
R의 1- 표본 Kolmgorov-Smirnov 테스트에서 "타이가 없어야 함"
R에서 MYDATA의 정규성을 테스트하기 위해 Kolmogorov-Smirnov 테스트를 사용할 것입니다. 이것이 제가하는 일의 예입니다 ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) 다음은 R이 제공하는 결과입니다. data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties should not be present for the Kolmogorov-Smirnov test 문제가 있다고 생각합니다. "경고"가이 …

4
부트 스트랩 vs 몬테카를로, 오류 추정
나는 지구 화학 계산에서 Monte Carlo 방법에 의한 오류 전파 기사 Anderson (1976)을 읽고 있으며 이해하지 못하는 것이 있습니다. 일부 측정 데이터 고려 및 프로그램 이이를 처리 복귀 소정 값. 이 기사에서이 프로그램은 먼저 데이터 수단을 사용하여 최상의 값 을 얻는 데 사용됩니다 (예 : ).{ A , B , …

3
올가미 대 적응 올가미
LASSO와 적응 형 LASSO는 서로 다른 두 가지입니다. (벌칙은 다르게 보이지만, 내가 놓친 것이 있는지 확인하고 있습니다.) 일반적으로 탄력적 그물에 대해 말할 때 특별한 경우 LASSO 또는 적응 형 LASSO입니까? alpha = 1을 선택하면 glmnet 패키지는 어떤 기능을 수행합니까? 적응 형 LASSO는 더 온화한 조건에서 작동합니다. 둘 다 오라클 데이터가 …

2
로그 차이 시계열 모델이 성장률보다 우수합니까?
저자들이 종종 "로그 차이"모델을 추정하는 것을 본다. 로그( y티) − 로그( yt - 1) = 로그( y티/ yt - 1) = α + β엑스티로그⁡(와이티)−로그⁡(와이티−1)=로그⁡(와이티/와이티−1)=α+β엑스티\log (y_t)-\log(y_{t-1}) = \log(y_t/y_{t-1}) = \alpha + \beta x_t 가 동안 를 의 백분율 변화 와 관련시키는 것이 적절하다는 데 동의합니다 .엑스티엑스티x_t와이티와이티y_t로그( y티)로그⁡(와이티)\log (y_t)나는( 1 )나는(1)I(1) 그러나 …

1
조건부 분포를 사용하여 한계 분포에서 샘플링?
일 변량 밀도 에서 샘플링하고 싶지만 관계 만 알고 있습니다.에프엑스fXf_X 에프엑스( x ) = ∫에프엑스| 와이( x | y) f와이( y) d와이.fX(x)=∫fX|Y(x|y)fY(y)dy.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. 나는 때문에, (직접 적분 표현에) MCMC의 사용을 피하고 싶은 및 f Y ( y ) 는 샘플링하기 쉽고 다음 샘플러를 사용하려고 생각했습니다.에프엑스| …

3
차이는 요약 통계입니다 : Gini 계수 및 표준 편차
몇 가지 요약 통계가 있습니다. 분포의 분포를 설명하려는 경우 표준 편차 또는 Gini 계수 등을 사용할 수 있습니다 . 표준 편차는 중심 경향, 즉 평균 편차와 Gini 계수, 분산의 일반적인 측정치를 기반으로한다는 것을 알고 있습니다. 또한 Gini 계수는 하한과 상한을 가지고 있으며 표준 편차는 없습니다 . 이러한 속성을 아는 것이 …



1
기차 대기 시간의 베이지안 모델링 : 모델 정의
이것은 잦은 야영지에서 누군가 베이지안 데이터 분석을하기위한 첫 시도입니다. A. Gelman의 Bayesian Data Analysis에서 여러 자습서와 몇 개의 장을 읽었습니다. 내가 선택한 첫 번째 다소 독립적 인 데이터 분석 예제는 기차 대기 시간입니다. 나는 나 자신에게 물었다 : 대기 시간의 분포는 무엇인가? 데이터 세트는 블로그 에서 제공되었으며 PyMC 외부와 약간 …
12 bayesian  pymc 

1
순열 테스트에 대한 신뢰 구간 및 P 값 불확실성
지금 무작위 테스트를 배우고 있습니다. 내 마음에 오는 두 가지 질문이 있습니다. 그렇습니다. 랜덤 화 테스트를 사용하여 p- 값을 계산하는 방법이 쉽고 직관적입니다 (순열 테스트와 동일하다고 생각합니까?). 그러나 일반적인 모수 검정과 마찬가지로 어떻게 95 % 신뢰 구간을 생성 할 수 있습니까? 순열 테스트 에 관한 University of Washington의 문서를 읽을 …


3
경로 c는 중요하지 않지만 경로 a와 b는 중요하다면? 중재에서 간접 효과
클래식 중개 모델에는 아래 다이어그램에 표시된 경로가 있습니다. , 여기서 X와 Y 사이의 M의 매개 효과를 테스트하는 첫 번째 단계는 X가 Y와 크게 상관되어 있다는 것입니다 (그림의 패널 A에 표시됨). 그러나 Path a 와 Path b 가 강력하지만 Path C가 아닌 상황에 부딪 쳤습니다 . 경로 c와 비교하여 경로 c …

2
요인 회전 방법 (varimax, oblimin 등)-이름의 의미와 방법의 의미
요인 분석에는 varimax, quartimax, equamax, promax, oblimin 등과 같은 여러 회전 방법이 있습니다. 이름을 실제 수학 또는 통계적 수행과 관련이있는 정보를 찾을 수 없습니다. 왜 "equa-max"또는 "quarti-max"라고합니까? 축이나 행렬은 어떤 방식으로 회전되어 그러한 이름을 갖습니까? 불행히도, 그들 대부분은 1950 년대에서 1970 년대에 발명되었으므로 저자와 연락 할 수 없습니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.