통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
로지스틱 회귀 설정에서 제곱 손실을 사용하면 어떻게됩니까?
장난감 데이터 세트에서 이진 분류를 수행하기 위해 제곱 손실을 사용하려고합니다. mtcars데이터 세트를 사용하고 있으며 갤런 당 마일과 무게를 사용 하여 전송 유형을 예측합니다. 아래 그림은 서로 다른 색상의 두 가지 유형의 전송 유형 데이터와 서로 다른 손실 함수로 생성 된 결정 경계를 보여줍니다. 제곱 손실은 여기서 는 기본 진리 레이블 …


2
왜 "표준"편차라고합니까?
단순하고 아마도 사소한 질문이 있습니다. 왜 표준 편차가 " 표준 " 이라고 불리는 것일까 요? 분산과 관련하여 데이터 세트와 결과의 비교를 표준화하기 때문입니까? Stack Exchange를 검색해도이 질문이 나오지 않으며 용어 의 어원 에 대한 Google 검색도 많은 가치를 얻지 못합니다 .

2
로지스틱 회귀 분석의 Pearson VS 편차 잔차
표준화 된 Pearson 잔차는 전통적인 확률 론적 방식으로 얻어진다는 것을 알고 있습니다. ri=yi−πiπi(1−πi)−−−−−−−−√ri=yi−πiπi(1−πi) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} 이탈 잔차는보다 통계적인 방법 (각 지점의 가능성에 대한 기여도)을 통해 얻습니다. di=si−2[yilogπi^+(1−yi)log(1−πi)]−−−−−−−−−−−−−−−−−−−−−−−−−−√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i \sqrt{-2[y_i \log \hat{\pi_i} + (1 - y_i)\log(1-\pi_i)]} 여기서, 경우 (1) = Y 난 = 1과 s의 난 = -1 …


2
이항 분포 의
이 질문의 기술 후속 인 이 질문에 . Raftery (1988) : 이항 매개 변수에 대한 추론 :NNN WinBUGS / OpenBUGS / JAGS 의 계층 적 Bayes 접근 방식 에 제시된 모델을 이해하고 복제하는 데 어려움이 있습니다. 그것은 코드에 관한 것이 아니라 여기서 주제에 관한 것이어야합니다. 배경 하자 알 수있는 이항 …

1
통계는 기계입니다 ... 견적
다가오는 회의에서 비 통계 학자에게 프로젝트를 제시해야하며 통계와 광석을 처리하는 기계를 비교할 때 읽은 인용문을 포함하고 싶습니다. 그 이유는 통계 기능과 잠재 고객의 목표 사이의 특정 연결을 강조하고 싶기 때문입니다. 나는 인용문을 찾을 수 없었고 누군가가 나를 인용 할 수 있기를 바랐다. 다음과 같은 내용이 있습니다. 광석에서 금을 추출하는 경우를 …


1
lmer () 모델에서 랜덤 효과의 분산 이해
lmer()모델 의 출력을 이해하는 데 문제가 있습니다. 다양한 상태 차단 / 상태 랜덤 효과가있는 결과 변수 (지원)의 간단한 모델입니다. mlm1 <- lmer(Support ~ (1 | State)) 결과 summary(mlm1)는 다음 과 같습니다. Linear mixed model fit by REML Formula: Support ~ (1 | State) AIC BIC logLik deviance REMLdev 12088 12107 …

2
CART에서 복잡성 매개 변수 선택
CART 모델을 작성하기위한 rpart () 루틴에서 트리를 제거하려는 복잡성 매개 변수를 지정합니다. 복잡성 매개 변수를 선택하기위한 두 가지 다른 권장 사항을 보았습니다. 가능한 최소 교차 검증 오류와 관련된 복잡성 매개 변수를 선택하십시오. 이 방법은 Quick-R 및 HSAUR에서 권장합니다 . 추정 된 교차 검증 된 오류가 여전히 가능한 최소 교차 검증 …
16 r  cart  rpart 

2
관찰 된 정보 매트릭스는 예상되는 정보 매트릭스의 일관성있는 추정기입니까?
나는 약하게 일관된 최대 가능성 추정기 (MLE)에서 평가 된 관측 된 정보 매트릭스가 기대되는 정보 매트릭스의 약하게 일관된 추정기임을 증명하려고 노력하고있다. 이것은 널리 인용 된 결과이지만 아무도 참조 또는 증거를 제공하지 않습니다 (Google 결과의 첫 20 페이지와 통계 교과서가 소진되었다고 생각합니다)! 약하게 일관된 MLE 시퀀스를 사용하면 약한 수의 법칙 (WLLN)과 …

1
다중 사이트 연구에서 혼합 모형과 풀링 표준 오차-혼합 모형이 훨씬 더 효율적인 이유는 무엇입니까?
소수의 사이트에서 일련의 "브로큰 스틱"월간 사례 수로 구성된 데이터 세트가 있습니다. 두 가지 기술로 단일 요약 견적을 얻으려고합니다. 기술 1 : 0/1 표시기 변수가있는 Poisson GLM에 "브로큰 스틱"을 맞추고 시간 및 시간 ^ 2 변수를 사용하여 시간 추세를 제어합니다. 0/1 인디케이터 변수의 추정치와 SE는 꽤 직선적 인 위 / 아래 …


1
반복적으로 가중 된 최소 제곱의 정의 및 수렴
다음 형식의 기능을 최소화하기 위해 반복적으로 가중치를 매기는 최소 제곱 (IRLS)을 사용하고 있습니다. J(m)=∑Ni=1ρ(|xi−m|)J(m)=∑i=1Nρ(|xi−m|)J(m) = \sum_{i=1}^{N} \rho \left(\left| x_i - m \right|\right) 여기서 은 의 인스턴스 수이고 , 은 내가 원하는 강력한 추정치이며 는 적절한 강력한 페널티 함수입니다. 그것이 볼록하고 (엄격히 엄격하지는 않지만) 현재로서는 구별 할 수 있다고 가정 해 …

2
R의 정규성 또는 분산의 동등성이없는 데이터에 대해 양방향 분산 분석을 실행하는 방법은 무엇입니까?
현재 마스터 논문을 작성 중이며 SigmaPlot으로 통계를 실행할 계획입니다. 그러나 내 데이터로 시간을 보낸 후 SigmaPlot이 내 문제에 맞지 않을 수 있다는 결론에 도달했습니다 (실수로 잘못되었을 수 있음) .R에서 첫 번째 시도를 시작했기 때문에 정확하게 쉽지 않았습니다. 계획은 3 가지 다른 단백질과 8 가지 다른 처리에서 나온 데이터에 대해 간단한 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.