통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
이 발췌문에서 표준 편차의 편향 추정이 일반적으로 적합하지 않다고 말하는 이유는 무엇입니까?
나는 표준 편차의 편견없는 추정과 내가 읽은 소스의 계산에 대해 읽었습니다. (...) 일부 중요한 상황을 제외하고,이 작업은 유의성 테스트 및 신뢰 구간 사용 또는 베이지안 분석 사용과 같은 표준 절차에 의해 필요하지 않기 때문에 통계 적용과 거의 관련이 없습니다. 예를 들어 신뢰 구간이 계산의 일부로 표준 편차를 사용하지 않는 등 …

2
최소 제곱 계수를 버림으로써 희소성
정규화 된 X 에 대해 를 회귀한다고 가정합니다.와이와이Y엑스엑스X 싶지만 스파 스 솔루션을 . 회귀 후 왜 가장 작은 크기의 계수를 폐기 할 수 없습니까? 기록을 위해 LARS 및 LASSO 방법에 대해 들었고 종종 사용합니다. 위의 접근 방식이 적용되지 않는 이유가 궁금합니다.

2
표본 크기가 다른 그룹 평균을 기반으로하는 예측 변수가있는 경우 어떻게해야합니까?
당신은 결과가 어디 고전적인 데이터 분석 문제를 고려 YiYiY_{i} 그리고 그것은 예측의 수와 관련되는 방법 Xi1,...,XipXi1,...,XipX_{i1}, ..., X_{ip} . 여기서 염두에 두어야 할 기본 응용 프로그램 유형은 YiYiY_{i} 는 도시 의 범죄율과 같은 그룹 수준의 결과 입니다.iii 예측 변수는 도시 인구 통계 학적 특징과 같은 그룹 레벨 특성 입니다.iii 기본 …

1
제로 팽창 된 포아송 회귀
가정 독립적이며Y=(Y1,…,Yn)′Y=(Y1,…,Yn)′ \textbf{Y} = (Y_1, \dots, Y_n)' Yi=0Yi=kwith probability pi+(1−pi)e−λiwith probability (1−pi)e−λiλki/k!Yi=0with probability pi+(1−pi)e−λiYi=kwith probability (1−pi)e−λiλik/k!\eqalign{ Y_i = 0 & \text{with probability} \ p_i+(1-p_i)e^{-\lambda_i}\\ Y_i = k & \text{with probability} \ (1-p_i)e^{-\lambda_i} \lambda_{i}^{k}/k! } 또한 가정 파라미터 및 P = ( P 1 , ... , P는 N을 ) 충족λ=(λ1,…,λn)′λ=(λ1,…,λn)′\mathbf{\lambda} …

1
정방향 회귀 알고리즘은 무엇입니까?
어쩌면 피곤한 것일 수도 있지만 Forward Stagewise Regression 알고리즘을 이해하는 데 어려움을 겪고 있습니다. 에서 "통계 학습의 요소" 60 페이지 : 전단계 회귀 (FS)는 전단계 회귀보다 훨씬 더 제한적입니다. 그것은 [y]의 평균과 동일한 절편을 갖는 순차 단계적 회귀처럼 시작하며, 계수가 처음 인 중심 예측 변수는 모두 0입니다. 각 단계에서 알고리즘은 …

1
지수 적합의 잔차 제곱합을 최소화하는 방법은 무엇입니까?
나는 다음과 같은 데이터를 가지고 있으며 음의 지수 성장 모델에 맞추고 싶다. Days <- c( 1,5,12,16,22,27,36,43) Emissions <- c( 936.76, 1458.68, 1787.23, 1840.04, 1928.97, 1963.63, 1965.37, 1985.71) plot(Days, Emissions) fit <- nls(Emissions ~ a* (1-exp(-b*Days)), start = list(a = 2000, b = 0.55)) curve((y = 1882 * (1 - exp(-0.5108*x))), …

1
R을 사용하여 이분법 데이터 (이진 변수)에 대한 요인 분석의 예를 살펴 보는 단계
나는 이분법적인 데이터 만 있고 이진 변수 만 있고 상사는 테트라 코릭 상관 행렬을 사용하여 요인 분석을 수행하도록 요청했습니다. 이전에 여기와 UCLA의 통계 사이트 및 기타 사이트 에서 예제를 기반으로 다른 분석을 실행하는 방법을 스스로 가르쳐 왔지만 이분법에 대한 요인 분석의 예를 단계별로 찾을 수는 없습니다. R을 사용하여 데이터 (이진 …

2
카운트의 표준 오차
희귀 질환의 계절별 사건 사례 데이터 세트가 있습니다. 예를 들어, 봄에는 180 건, 여름에는 90 건, 가을에는 45 건, 겨울에는 210 건이 있다고 가정합니다. 이 숫자에 표준 오류를 첨부하는 것이 적절한 지 고민하고 있습니다. 연구 목표는 향후 재발 할 수있는 질병 발생률의 계절적 패턴을 찾고 있다는 점에서 중요하지 않습니다. 따라서 …

1
직교 다항식 회귀 분석에서 원시 계수 및 분산 복구
y i ~ β 0 + β 1 x i + β 2 x 2 i + β 3 x 3 i 와 같은 회귀 모형이있는 경우yi∼β0+β1xi+β2x2i+β3x3iyi∼β0+β1xi+β2xi2+β3xi3y_i \sim \beta_0 + \beta_1 x_i+\beta_2 x_i^2 +\beta_3 x_i^3나는 원시 다항식에 적합하고 신뢰할 수없는 결과를 얻거나 직교 다항식에 적합하며 직접적인 물리적 해석이없는 계수를 얻을 …


1
랜덤 효과가있는 모형에 대해 lmer을 사용하여 분산 성분을 추정하고 lme 결과와 비교하는 방법
나는 두 개의 다른 출처에서 온 다른 가족을 키우는 실험을 수행했습니다. 각 가족에게는 두 가지 치료법 중 하나가 배정되었습니다. 실험 후 나는 각 개인에 대한 몇 가지 특성을 측정했다. 치료 또는 소스의 효과와 상호 작용을 테스트하기 위해 가족과 함께 임의 요인으로 선형 혼합 효과 모델을 사용했습니다. lme(fixed=Trait~Treatment*Source,random=~1|Family,method="ML") 지금까지는 상대적 분산 …
14 r  anova  variance  lme4-nlme 

3
숨겨진 Markov 모델 임계 값
mfcc 및 숨겨진 마르코프 모델을 사용하여 사운드 인식을위한 개념 증명 시스템을 개발했습니다. 알려진 사운드에서 시스템을 테스트 할 때 유망한 결과를 제공합니다. 시스템은 알려지지 않은 사운드가 입력 될 때 가장 근접한 결과를 반환하고 악보를 결정하기 위해 점수가 그다지 명확하지 않습니다. 예 : 나는 숨은 마르코프 모델 3 개를 연설 용으로, 하나는 …

1
이진 데이터와 관련된 분산 및 분할 변화
물류 선형 혼합 효과 모델 (무작위 가로 채기)을 사용하여 175 개 학교에서 30 만 명의 학생에 대한 데이터를 분석하고 있습니다. 각 학생은 정확히 한 번만 발생하며 데이터는 6 년에 걸쳐 있습니다. 지속적인 결과를 위해 VPC / ICC와 비슷한 방식으로 학교와 학생 수준의 차이를 어떻게 분할합니까? 나는 A와 B가 나에게 흥미로운 …


1
범주 형 변수 (R)에 사용할 수있는 다양한 코딩 유형은 무엇이며 언제 사용합니까?
선형 모델 또는 혼합 모델에 적합하면 범주 형 또는 명목 형 변종을 더미 콘딩 (R 기본값) 및 효과 코딩과 같이 매개 변수가 추정되는 여러 변수로 변환하는 데 사용할 수있는 다양한 유형의 코딩이 있습니다. 상호 작용이있을 때 효과 코딩 (때로는 편차 또는 대비 코딩이라고 함)이 선호된다고 들었지만 가능한 대비는 언제이며 어떤 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.