통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
인과 관계 베이지안 네트워크에서의 d- 분리 이론 이해
Causal Bayesian Networks의 d-Separation 논리를 이해하려고합니다. 알고리즘의 작동 방식을 알고 있지만 알고리즘에 명시된대로 "정보 흐름"이 작동 하는 이유를 정확히 이해하지 못합니다 . 예를 들어 위의 그래프에서 우리에게 X 만 주어지고 다른 변수는 관찰되지 않았다고 생각합시다. 그런 다음 d- 분리 규칙에 따라 정보가 X에서 D로 흐릅니다. X는 줍니다. A는 X를 유발하고 …

1
분산에 대한 신뢰 구간을 생성 할 때 카이 제곱이 사용되는 이유는 무엇입니까?
이것은 매우 기본적인 질문입니다. 카이 제곱 분포를 사용하는 이유는 무엇입니까? 이 배포판의 의미는 무엇입니까? 이 분포가 분산에 대한 신뢰 구간을 만드는 데 사용되는 이유는 무엇입니까? 내가 설명은 구글 모든 장소는 카이를 사용하는 경우를 설명하지만, 설명하지,이 사실을 제시 하는 이유 카이를 사용하고,이 방법을 보이는 이유는 않습니다. 올바른 방향으로 나를 가리킬 수있는 …

1
상관 계수 공식을 이해하는 방법은 무엇입니까?
피어슨 상관 관계 공식을 이해하는 데 도움을 줄 수 있습니까? 표본 r아르 자형r = 변수 X엑스X 와 의 표준 점수에 대한 곱의 평균 Y와이Y. 와 Y 를 표준화 해야하는 이유 를 이해하지만 두 z 점수의 곱을 이해하는 방법은 무엇입니까? X엑스XY와이Y 이 공식은 "제품-모멘트 상관 계수"라고도하지만 제품 동작의 근거는 무엇입니까? 내 …

1
LASSO 변수 추적 플롯 해석
나는 glmnet패키지를 처음 접했고 결과를 해석하는 방법을 여전히 확신하지 못한다. 누구든지 다음 추적 플롯을 읽도록 도와 줄 수 있습니까? 다음을 실행하여 그래프를 얻었습니다. library(glmnet) return <- matrix(ret.ff.zoo[which(index(ret.ff.zoo)==beta.df$date[2]), ]) data <- matrix(unlist(beta.df[which(beta.df$date==beta.df$date[2]), ][ ,-1]), ncol=num.factors) model <- cv.glmnet(data, return, standardize=TRUE) op <- par(mfrow=c(1, 2)) plot(model$glmnet.fit, "norm", label=TRUE) plot(model$glmnet.fit, "lambda", label=TRUE) par(op)

2
피타고라스 정리로서의 총 분산 법칙
XXX 와 에 유한 한 순간이 있다고 가정합니다 . 두 번째 유한 모멘트를 갖는 랜덤 변수의 힐버트 공간에서 ( 의해 정의 된 의 내부 곱 , ), 의 돌기로서 의 함수의 공간 상 .YYYT1,T2T1,T2T_1,T_2E(T1T2)E(T1T2)E(T_1T_2)||T||2=E(T2)||T||2=E(T2)||T||^2=E(T^2)E(Y|X)E(Y|X)E(Y|X)YYYXXX 또한 총 분산 법칙에 Va r ( Y) = E( Va r ( Y| 엑스) ) …

2
플랫, 컨쥬 게이트 및 초 우선. 그들은 무엇인가?
현재 Yang의 계산 분자 진화에서 베이지안 방법에 대해 읽고 있습니다. 5.2 절에서는 이전, 특히 비 정보 / 플랫 / 모호한 / 확산, 켤레 및 초 이전에 대해 설명합니다. 이것은 지나치게 단순화를 요구할 수도 있지만 누군가가 이러한 유형의 이전의 차이점과 그것이 베이지안 분석 과정에서 내가 수행 할 분석 / 결정의 결과에 …
15 bayesian  prior 


2
영향력있는 지점, 높은 레버리지 지점 및 특이점 간의 정확한 의미와 비교
위키 백과에서 영향력있는 관측치 는 회귀 모형의 예측에 상대적으로 큰 영향을주는 관측치입니다. 위키 백과에서 레버리지 포인트 는 독립적 인 변수의 극한 또는 외부 값에서 수행 된 관측 값으로, 주변 관측치가 부족하면 적합 회귀 모형이 해당 특정 관측치에 가깝게 통과 함을 의미합니다. Wikipedia 에서 다음과 같은 비교 를 하는 이유 있지만 …



1
비모수 테스트를 대체하기 위해 부트 스트랩을 사용할 수 있습니까?
나는 통계에 상당히 익숙하지 않다. 부트 스트랩 개념은 혼란 스러웠습니다. 나는 t- 테스트와 같은 특정 테스트를 사용하려면 샘플링 분포의 정규성이 필요하다는 것을 알고 있습니다. SPSS에서 t-tests에서 "bootstrapping"을 요청하여 데이터가 정상적으로 분포되지 않은 경우 비정규 성 문제를 피할 수 있습니까? 그렇다면 부트 스트랩 된 샘플링 분포를 기반으로 출력에보고되는 t- 통계량입니까? 또한 …


5
통계 모델을 정확히 구축하는 것은 무엇입니까?
통계 모델을 정확히 구축하는 것은 무엇입니까? 요즘 연구 작업이나 컨설팅 작업을 신청할 때 종종 "모델 구축"또는 "모델링"이라는 용어가 등장합니다. 이 용어는 멋지게 들리지만 정확히 무엇을 의미합니까? 어떻게 당신은 당신의 모델을 구축? k-nn 및 로지스틱 회귀 분석을 포함한 예측 모델링을 찾았습니다 .
15 modeling 

1
위험 비율을 생존 시간의 중간 비율로 변환 할 수 있습니까?
생존 분석 결과를 설명하는 한 논문에서 나는 공식을 사용하여 위험 비율 (HR)을 평균 생존 시간 비율 ( 및 ) 로 변환 할 수 있음을 암시하는 진술을 읽었습니다 .미디엄1미디엄1M_1미디엄2미디엄2M_2 HR = M1미디엄2H아르 자형=미디엄1미디엄2HR = \frac{M_1}{M_2} 비례 위험 모델을 취할 수 없을 때 유지되지 않습니다 (HR이 잘 정의되어 있지 않으면 아무것도 작동하지 …
15 survival  hazard 

1
일별 데이터를 사용한 시계열 예측 : 회귀 분석 기능이있는 ARIMA
약 2 년의 일일 데이터 포인트가 포함 된 일일 시계열 판매 데이터를 사용하고 있습니다. 온라인 자습서 / 예제 중 일부를 기반으로 데이터의 계절성을 확인하려고했습니다. 주별, 월별 및 아마도 연간 주기성 / 계절성이있는 것 같습니다. 예를 들어, 월중 첫 번째 월급 날 효과에 주중에 며칠 동안 지속되는 월급이 있습니다. 관측 값을 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.