통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


1
중복 평균 매개 변수화가 Gibbs MCMC의 속도를 높이는 이유는 무엇입니까?
Gelman & Hill (2007)의 저서 (회귀 및 다중 레벨 / 계층 모델을 사용한 데이터 분석)에서 저자는 중복 평균 매개 변수를 포함하면 MCMC 속도를 높일 수 있다고 주장합니다. 주어진 예제는 "비행 시뮬레이터"(Eq 13.9)의 중첩되지 않은 모델입니다. yiγjδk∼N(μ+γj[i]+δk[i],σ2y)∼N(0,σ2γ)∼N(0,σ2δ)yi∼N(μ+γj[i]+δk[i],σy2)γj∼N(0,σγ2)δk∼N(0,σδ2) \begin{align} y_i &\sim N(\mu + \gamma_{j[i]} + \delta_{k[i]}, \sigma^2_y) \\ \gamma_j &\sim N(0, \sigma^2_\gamma) …

2
Kaggle 대회가 우연히 이겼습니까?
캐글 대회는 개최 테스트 세트를 기반으로 최종 순위를 결정합니다. 보류 된 테스트 세트는 샘플입니다. 모델링되는 모집단을 대표하지 않을 수도 있습니다. 각 제출은 가설과 같으므로 경쟁에서이긴 알고리즘은 우연히 테스트 세트를 다른 것보다 더 잘 일치시킬 수 있습니다. 다시 말해, 다른 테스트 세트가 선택되고 경쟁이 반복되는 경우 순위는 동일하게 유지됩니까? 후원 회사의 …

2
p- 값을 기준으로 기능을 선택하는 것이 잘못 되었습니까?
기능을 선택하는 방법에 대한 몇 가지 게시물이 있습니다. 이 방법 중 하나는 t- 통계량에 따라 기능의 중요성을 설명합니다. 표준화 된 피쳐가있는 varImp(model)선형 모형에 적용된 R에서는 각 모형 매개 변수에 대한 t- 통계량의 절대 값이 사용됩니다. 따라서 기본적으로 t- 통계량을 기준으로 피처를 선택합니다. 이는 계수의 정확도를 의미합니다. 그러나 나의 계수의 정확성은 …

2
칼만 필터를 사용하는 방법?
2D 공간 (표면)에 객체의 궤도가 있습니다. 궤적은 일련의 (x,y)좌표로 제공됩니다. 측정 값이 시끄럽고 때로는 특이 치가 있습니다. 따라서 관측치를 필터링하고 싶습니다. 내가 칼만 필터를 이해하는 한, 내가 필요한 것을 정확하게 수행합니다. 그래서 나는 그것을 사용하려고합니다. 여기 에서 파이썬 구현을 발견했습니다 . 그리고 이것은 문서가 제공하는 예입니다. from pykalman import KalmanFilter …


2
QQ 플롯은 정상적으로 보이지만 Shapiro-Wilk 테스트에서 그렇지 않다고 말합니다
R에는 348 개의 측정 값 샘플이 있으며, 향후 테스트를 위해 정상적으로 분포되어 있다고 가정 할 수 있는지 알고 싶습니다. 본질적으로 다른 스택 답변 을 따라 밀도 플롯과 QQ 플롯을보고 있습니다. plot(density(Clinical$cancer_age)) qqnorm(Clinical$cancer_age);qqline(Clinical$cancer_age, col = 2) 통계에 대한 경험이 많지 않지만 내가 본 정규 분포의 예처럼 보입니다. 그런 다음 Shapiro-Wilk 테스트를 …

3
기능 수를 줄일 수있을 때 PCA를 사용하여 학습 알고리즘의 속도를 높이는 이유는 무엇입니까?
머신 러닝 과정에서 PCA ( Principal Component Analysis ) 의 일반적인 용도 중 하나 는 다른 머신 러닝 알고리즘의 속도를 높이는 것입니다. 예를 들어 로지스틱 회귀 모델을 학습한다고 가정합니다. 1에서 n까지 i에 대한 훈련 세트 가 있고 벡터 x의 치수가 매우 크다는 것을 알 수 있습니다 (치수를 말하십시오) .PCA를 사용하여 …

2
그라디언트 디센트는이 데이터 세트에서 보통 최소 제곱에 대한 솔루션을 찾지 못합니까?
나는 선형 회귀를 연구하고 아래 세트 {(x, y)}에서 시도했습니다. 여기서 x는 평방 피트 단위의 주택 면적을 지정하고 y는 가격을 달러 단위로 지정했습니다. Andrew Ng Notes 의 첫 번째 예입니다 . 2104,400 1600,330 2400,369 1416,232 3000,540 샘플 코드를 개발했지만 실행할 때 각 단계마다 비용이 증가하는 반면 각 단계마다 비용이 감소합니다. 아래에 …

2
경험 재생에 정책 외 알고리즘이 필요한 이유는 무엇입니까?
DQN " 심화 강화 학습으로 Atari 재생 "을 소개하는 논문 에서 다음과 같이 언급했습니다. 경험 재생을 통해 학습하는 경우 Q 정책 학습의 선택에 동기를 부여하는 정책 외 학습 (현재의 매개 변수가 샘플 생성에 사용 된 것과 다르기 때문에)을 학습해야합니다. 나는 그것이 무엇을 의미하는지 이해하지 못했습니다. SARSA를 사용 하고 메모리에서 a'취할 …

2
규칙 및 규칙이란 무엇입니까?
기계 학습을 공부하면서이 단어들을 점점 더 많이 듣고 있습니다. 실제로 일부 사람들은 규칙의 규칙에 따라 Fields 메달을 수상했습니다. 저는 이것이 통계 물리 / 수학에서 기계 학습에 이르는 용어라고 생각합니다. 당연히, 내가 요청한 많은 사람들이 직관적으로 설명 할 수 없었습니다. 나는 드롭 아웃과 같은 방법이 정규화에 도움이된다는 것을 알고 있습니다 (=> …

2
심플 렉스 방법으로 최소 절대 편차를 해결하는 방법은 무엇입니까?
다음은 가장 절대적인 편차 문제입니다.. LP 방식으로 다음과 같이 재배치 할 수 있다는 것을 알고 있습니다.argminwL(w)=∑ni=1|yi−wTx|arg⁡minwL(w)=∑i=1n|yi−wTx| \underset{\textbf{w}}{\arg\min} L(w)=\sum_{i=1}^{n}|y_{i}-\textbf{w}^T\textbf{x}| min∑ni=1uimin∑i=1nui\min \sum_{i=1}^{n}u_{i} ui≥xTw−yii=1,…,nui≥xTw−yii=1,…,nu_i \geq \textbf{x}^T\textbf{w}- y_{i} \; i = 1,\ldots,n ui≥−(xTw−yi)i=1,…,nui≥−(xTw−yi)i=1,…,nu_i \geq -\left(\textbf{x}^T\textbf{w}-y_{i}\right) \; i = 1,\ldots,n 그러나 LP의 초보자이기 때문에 단계별로 해결할 생각이 없습니다. 당신은 어떤 아이디어가 있습니까? 미리 감사드립니다! 편집하다: …


4
비율에 대한 신뢰 구간을 계산하는 방법은 무엇입니까?
0과 1 사이 의 비율 를 출력하는 실험을 고려하십시오. 이 비율을 얻는 방법은이 맥락에서 관련이 없어야합니다. 이 질문의 이전 버전 에서 자세히 설명 되었지만 메타에 대한 토론 후에 명확성을 위해 제거되었습니다 .엑스나는XiX_i 이 실험은 번 반복되는 반면 은 작습니다 (약 3-10). 독립적이고 동일하게 분산 된 것으로 간주됩니다. 이로부터 평균 를 …

2
MCMC 샘플의 모드 신뢰성
John Kruschke는 그의 저서 인 Doing Bayesian Data Analysis에서 R의 JAGS를 사용할 때 ... MCMC 샘플의 모드 추정값은 MCMC 샘플의 랜덤 범프와 리플에 민감 할 수있는 평활 알고리즘을 기반으로하기 때문에 다소 불안정 할 수 있습니다. ( 205 페이지 베이 즈 데이터 분석 수행 , 섹션 8.2.5.1) Metropolis 알고리즘과 Gibbs 샘플링과 …
12 bayesian  mcmc  mode 

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.