통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
cv.glmnet (R의 LASSO 회귀)으로 교차 유효성 검사를 수행하는 방법은 무엇입니까?
R에서 glmnet을 사용하여 LASSO 모델을 올바르게 훈련하고 테스트하는 방법에 대해 궁금합니다. 특히 외부 테스트 데이터 세트가 부족한 경우 교차 검증 (또는 다른 유사한 방법)을 사용하여 LASSO 모델을 테스트 하는 방법을 궁금합니다 . 시나리오를 정리하겠습니다 : 내 glmnet 모델을 알리고 훈련 할 데이터 세트가 하나뿐입니다. 결과적으로 교차 검증을 사용하여 데이터를 분할하여 …

3
이진 데이터의 지표 변수 : {-1,1} vs {0,1}
나는 이진 처리 할당 지시자 와 함께 실험 / 무작위 통제 시험의 맥락에서 처리-공변량 상호 작용에 관심이있다 .TTT 특정 방법 / 소스에 따라 치료 대상자와 치료하지 않은 대상에 대해 각각 및 을 모두 보았습니다 .T={1,0}T={1,0}T=\{1,0\}T={1,−1}T={1,−1}T=\{1, -1\} {1,0}{1,0}\{1,0\} 또는 을 사용할 때 경험할만한 규칙이 {1,−1}{1,−1}\{1, -1\}있습니까? 해석은 어떤면에서 다른가?

2
랜덤 변수의 샘플은 무엇입니까?
랜덤 변수 는 기본 측정 단위 를 사용하여 하나의 -algebra 에서 다른 -algebra 까지 측정 가능한 함수로 정의됩니다 .σ ( Ω 1 , F 1 ) P σ ( Ω 2 , F 2 )XXXσσ\sigma(Ω1,F1)(Ω1,F1)(\Omega_1, \mathcal F_1)PPPσσ\sigma(Ω2,F2)(Ω2,F2)(\Omega_2, \mathcal F_2) 이 랜덤 변수의 샘플 에 대해 어떻게 이야기 합니까? 우리는 이것을 …

1
선형 혼합 모형에 대한 랜덤 효과 예측을 수동으로 계산
손으로 선형 혼합 모델에서 랜덤 효과 예측을 계산하려고 시도하고 Generalized Additive Models 에서 Wood가 제공 한 표기법을 사용하여 R (pg 294 / pg 307 of pdf)을 사용하여 각 매개 변수에 대해 혼란스러워합니다. 나타냅니다. 아래는 Wood의 요약입니다. 선형 혼합 모형 정의 와이= Xβ+ Zb + ϵ와이=엑스β+지비+ϵ Y = X\beta + Zb …

4
편견없는 추정자가 평신도에게 무엇을 설명 하는가?
가정 에 대한 편견 추정이다 . 물론 입니다. θE[ θ |θ]=θθ^θ^\hat{\theta}θθ\thetaE[θ^∣θ]=θE[θ^∣θ]=θ\mathbb{E}[\hat{\theta} \mid \theta] = \theta 이것을 평신도에게 어떻게 설명합니까? 당신의 값의 무리 평균 경우 과거에는 내가 말한 것은 샘플 크기가 커질수록, 당신의 더 나은 근사 얻을, . θθ^θ^\hat{\theta}θθ\theta 나에게 이것은 문제가있다. 나는 내가 실제로 여기에 설명하고있어되는이 현상이라고 생각 점근 적으로 …

1
몬테카를로 / MCMC 샘플러가 구현되어 후방 분포의 고립 된 국소 최대치를 처리 할 수 ​​있습니까?
현재 여러 ODE로 구성된 모델의 매개 변수를 추정하기 위해 베이지안 접근법을 사용하고 있습니다. 추정 할 매개 변수가 15 개이므로 샘플링 공간이 15 차원이고 구배 분포를 검색 한 결과 극도로 낮은 확률로 큰 영역에 의해 고립 된 국소 극대값이 많은 것 같습니다. 이것은 하나의 체인이 하나의 로컬 최대 값에서 "점프"하여 실수로 …

1
일반 옵티 마이저를 사용하여 glmnet 선형 회귀에 대한 결과 복제
제목에서 알 수 있듯이 라이브러리의 LBFGS 옵티 마이저를 사용하여 glmnet linear의 결과를 복제하려고합니다 lbfgs. 이 옵티마이 저는 목적 함수 (L1 정규화 용어가없는)가 볼록한 한, 미분에 대해 걱정할 필요없이 L1 정규화 용어를 추가 할 수 있습니다. 의 탄성 순 선형 회귀 문제 glmnet 용지가 주어진다 여기서 X \ in \ mathbb …




2
그래픽 모델과 Boltzmann 기계는 수학적으로 관련이 있습니까?
물리 클래스에서 Boltzmann 기계로 실제로 프로그래밍을 수행했지만 이론적 특성에 익숙하지 않습니다. 대조적으로, 나는 그래픽 모델 이론 (Lauritzen 's Book Graphical Models 의 처음 몇 장에 관한)에 대해 적당히 알고있다 . 질문 : 그래픽 모델과 Boltzmann 머신간에 의미있는 관계가 있습니까? Boltzmann 기계는 그래픽 모델 유형입니까? 분명히 볼츠만 기계는 신경망의 한 유형입니다. …

2
참조 요청 : 작업 데이터 과학자를위한 클래식 통계
저는 회귀 분석, 다른 기계 학습 유형 알고리즘 및 프로그래밍 (데이터 분석 및 일반 소프트웨어 개발 모두)에 대한 탄탄한 경험을 가진 실무 데이터 과학자입니다. 대부분의 작업 생활은 예측 정확도 (다양한 비즈니스 제약 조건 하에서 작업)를위한 모델을 구축하고 내 자신 및 다른 작업을 지원하는 데이터 파이프 라인을 구축하는 데 중점을 두었습니다. …

3
분류에서 LDA 대신 PCA를 언제 사용 하시겠습니까?
원리 성분 분석과 다중 판별 분석 (선형 판별 분석)의 차이점에 대한 이 기사 를 읽고 있으며 MDA / LDA가 아닌 PCA를 왜 사용해야하는지 이해하려고 노력하고 있습니다. 설명은 다음과 같이 요약됩니다. PCA에서 대략적으로 말하면 데이터가 가장 널리 퍼져있는 곳 (PCA가 전체 데이터 세트를 하나의 클래스로 취급하기 때문에 클래스 내에서)이 최대 편차를 …

1
R의 ARIMA 시계열에서 예측 된 값 플로팅
이 질문에는 하나 이상의 심각한 오해가있을 수 있지만 계산을 올바르게하는 것이 아니라 시계열을 배우는 데 중점을 둡니다. 시계열의 적용을 이해하려고 할 때, 데이터의 비추 세화로 미래의 가치를 예측할 수없는 것처럼 보입니다. 예를 들어 패키지의 gtemp시계열은 astsa다음과 같습니다. 예측 된 미래 가치를 표시 할 때 지난 수십 년간 상승 추세를 고려해야합니다. …

2
R에서 두 다항식 회귀 분석의 차이의 통계적 유의성을 비교합니다.
우선이 포럼에서 몇 가지 조사를 해본 결과 매우 비슷한 질문에 대한 답변을 받았지만 일반적으로 제대로 답변되지 않았거나 때로는 답변이 상세하지 않은 경우가 있습니다. 그래서 이번에는 내 질문은 : 나는 두 개의 데이터 세트를 가지고 있는데, 각각에 대해 다항식 회귀를 수행합니다. Ratio<-(mydata2[,c(2)]) Time_in_days<-(mydata2[,c(1)]) fit3IRC <- lm( Ratio~(poly(Time_in_days,2)) ) 다항식 회귀 도표는 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.