통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
두 회귀 계수의 비 편향 추정량?
편향 추정치 의 목표로 선형 / 물류 회귀 분석 를 가정합니다 . 과 는 추정에서 노이즈에 대해 매우 긍정적 이라고 확신합니다 .a 1g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2 a1a2a1a2a1a2\frac{a_1}{a_2}a1a1a_1a2a2a_2 공동 공분산 있는 경우 답을 계산하거나 적어도 시뮬레이션 할 수 있습니다. 더 나은 방법이 있습니까, 많은 데이터에 대한 …

1
반응 변수가 0에서 1 사이 인 혼합 모델을 맞추는 방법은 무엇입니까?
내가 사용하려고 lme4::glmer()바이너리 아닌 종속 변수지만, 0과 1 사이의 연속 변수와 이항 일반화 된 혼합 모델 (GLMM)를 맞게. 이 변수를 확률로 생각할 수 있습니다. 사실 그것은 이다 사람을 대상으로하여 (실험하는 I 도움말 분석에)보고 된 확률. 즉 그건 아니 는 "이산"분수하지만, 연속 변수입니다. 내 glmer()(아래 참조) 예상대로 호출이 작동하지 않습니다. 왜? …


4
우리는 어떤 종류의 실제 상황에서 다중 무기 산적 알고리즘을 사용할 수 있습니까?
다중 무기 산적은 선택이 있고 어느 쪽이 자신의 복지를 극대화 할 지 잘 모르는 상황에서 잘 작동합니다. 실제 상황에 따라 알고리즘을 사용할 수 있습니다. 예를 들어, 학습은 좋은 분야가 될 수 있습니다. 아이가 목공을 배우고 있고 그것에 나쁜 경우, 알고리즘은 아마 그 / 그녀가 계속 나아가 야한다고 알려줄 것입니다. 그가 …

1
확률 적 경사 하강은 어떻게 표준 경사 하강에 비해 시간을 절약 할 수 있습니까?
표준 그라디언트 디센트는 전체 교육 데이터 세트에 대한 그라디언트를 계산합니다. for i in range(nb_epochs): params_grad = evaluate_gradient(loss_function, data, params) params = params - learning_rate * params_grad 사전 정의 된 에포크 수에 대해 먼저 매개 변수 벡터 매개 변수를 사용하여 전체 데이터 세트에 대한 손실 함수의 기울기 벡터 weights_grad를 계산합니다. 대조적으로 …

2
우리 빈번 주의자들은 정말로 암묵적이거나 알지 못하는 베이지안인가?
주어진 추론 문제에 대해, 베이지안 접근 방식은 대개 형태와 결과가 Fequentist 접근 방식과 다르다는 것을 알고 있습니다. 상용 주의자들 (보통 저를 포함)은 종종 그들의 방법이 이전을 필요로하지 않기 때문에 "심사 주도"보다 "데이터 주도"라고 지적합니다. 물론, 베이지안은 비 정보적인 선행을 지적 할 수도 있고, 실용적이라면 실제로는 매우 확산 된 선행을 사용할 …

2
사건이“결국 일어난다”는 것은 무엇을 의미 하는가?
초기 상태 를 사용하여 정수 에서 1 차원 랜덤 워크를 고려하십시오 .ZZ\mathbb{Z}x∈Zx∈Zx\in\mathbb{Z} Sn=x+∑i=1nξiSn=x+∑i=1nξi\begin{equation} S_n=x+\sum^n_{i=1}\xi_i \end{equation} 여기서 증가 값 는 IID이므로 입니다.ξiξi\xi_i피{ ξ나는=1}=P{ξi=−1}=12P{ξi=1}=P{ξi=−1}=12P\{\xi_i=1\}=P\{\xi_i=-1\}=\frac{1}{2} 그것을 증명할 수 있습니다 (1) Px{Sn reaches +1 eventually}=1Px{Sn reaches +1 eventually}=1\begin{equation} P^x{\{S_n \text{ reaches +1 eventually}\}} = 1 \end{equation} 아래 첨자는 초기 위치를 나타냅니다. 하자 상태로 제 …

2
ABC와 MCMC의 응용 프로그램은 어떻게 다릅니 까?
대략적인 베이지안 계산 (ABC)과 마르코프 체인 몬테 카를로 (MCMC)는 비슷한 목표를 가지고 있습니다. 아래에서는 이러한 방법에 대한 이해와 실제 데이터에 대한 응용 프로그램의 차이점을 어떻게 인식하는지 설명합니다. 대략적인 베이지안 계산 ABC는 수치 시뮬레이션을 통해 관측 된 와 비교되는 통계 를 계산하여 이전 의 매개 변수 를 샘플링하는 것으로 구성됩니다 . …

4
반복 횟수가 증가함에 따라 그라디언트 부스팅 기계 정확도가 감소합니다.
caretR 의 패키지를 통해 그라디언트 부스팅 머신 알고리즘을 실험하고 있습니다 . 소규모 대학 입학 데이터 세트를 사용하여 다음 코드를 실행했습니다. library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- "yes" ### Gradient boosting machine algorithm. ### set.seed(123) fitControl …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

1
다단계 혼합 효과 모델에 대한 수학 방정식 작성
이력서 질문 혼합 효과 모델에 대해 (a) 상세하고 간결한 수학적 표현을 제공하려고합니다. lme4R 에서 패키지를 사용하고 있습니다. 모델에 올바른 수학 표현은 무엇입니까? 데이터, 과학 질문 및 R 코드 내 데이터 세트는 다른 지역의 종으로 구성됩니다. 종의 유병률이 멸종 (멸종이 반드시 영구적 일 필요는 없으며, 재 식민지화 될 수 있음)으로 이어 …

2
부적절한 분포에서 샘플링 (MCMC 등 사용)
내 기본 질문은 : 어떻게 당신은 부적절한 배포판에서 샘플링 할 것입니까? 부적절한 분포에서 표본을 추출하는 것이 합리적입니까? Xi'an의 의견은 여기에 일종의 질문을 제기하지만 이에 대한 자세한 내용을 찾고있었습니다. MCMC에보다 구체적 : MCMC에 대해 이야기하고 논문을 읽을 때 저자들은 적절한 후방 분포를 얻는 것에 중점을 둡니다. 유명한 Geyer (1992) 논문이 있는데, …

1
통계 알고리즘 개발자 후보에 대한 좋은 인터뷰 질문은 무엇입니까?
통계 / 기계 학습 / 데이터 마이닝 컨텍스트에서 알고리즘 개발자 / 연구원의 위치에 대해 사람들을 인터뷰하고 있습니다. 나는 기본 이론에 대한 후보의 친숙성, 이해 및 유동성, 예를 들어 기대 및 분산의 기본 특성, 일부 공통 분포 등을 결정하기 위해 질문을 찾고 있습니다. 나의 현재 이동-에 대한 질문은 : "알 수없는 …

2
가방 부족 오류로 인해 임의 포리스트에서 CV가 필요하지 않습니까?
나는 임의의 숲에 상당히 익숙합니다. 과거에는, 나는 항상의 정확성을 비교 한 시험 대에 맞게 에 대한 열차 대에 맞는 어떤 overfitting을 감지 할 수 있습니다. 그러나 나는 여기서 그것을 읽었 습니다 . "임의의 포리스트에서는 교차 검증 또는 별도의 테스트 세트가 필요하지 않으므로 테스트 세트 오류를 ​​편견없이 추정 할 수 있습니다. …


2
베이지안 추론의 사후 분포가 종종 다루기 어려운 이유는 무엇입니까?
베이지안 추론이 다루기 힘든 문제를 일으키는 이유를 이해하는 데 문제가 있습니다. 문제는 종종 다음과 같이 설명됩니다. 내가 이해하지 못하는 것은이 적분이 처음부터 평가되어야하는 이유입니다. 적분의 결과는 단순히 정규화 상수 (데이터 세트 D가 주어짐) 인 것 같습니다. 왜 사후 분포를 우변의 분자로 계산 한 다음 사후 분포에 대한 적분이 1이되도록 요구하여이 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.