통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
코헨의 통계량의 변화
Cohen의 는 효과의 크기를 측정하는 가장 일반적인 방법 중 하나입니다 ( Wikipedia 참조 ). 풀링 된 표준 편차로 두 평균 간의 거리 만 측정합니다. Cohen 의 분산 추정의 수학적 공식을 어떻게 도출 할 수 있습니까? ddddddd 2015 년 12 월 편집 : 이 질문 과 관련하여 주위의 신뢰 구간 을 …

2
Fisher 기준 가중치를 계산하는 방법은 무엇입니까?
패턴 인식과 기계 학습을 공부하고 있는데 다음 질문에 부딪 쳤습니다. 동일한 사전 등급 확률 클래스 분류 문제를 고려하십시오.P(D1)=P(D2)=12P(D1)=P(D2)=12P(D_1)=P(D_2)= \frac{1}{2} 그리고 각 클래스에서 인스턴스의 분포는 p(x|D1)=N([00],[2001]),p(x|D1)=N([00],[2001]), p(x|D_1)= {\cal N} \left( \begin{bmatrix} 0 \\0 \end{bmatrix}, \begin{bmatrix} 2 & 0 \\ 0 & 1 \end{bmatrix} \right), p(x|D2)=N([44],[1001]).p(x|D2)=N([44],[1001]). p(x|D_2)= {\cal N} \left( \begin{bmatrix} 4 …

2
베이지안 신경망 사용의 장점은 무엇입니까
최근에 나는 베이지안 신경망 (BNN)에 관한 논문을 읽었다 [Neal, 1992] , [Neal, 2012] , 신경망의 입력과 출력 사이의 확률 관계를 제공한다. 이러한 신경망을 훈련시키는 것은 전통적인 역 전파 알고리즘과는 다른 MCMC를 통해 이루어진다. 내 질문은 : 그런 신경망을 사용하면 어떤 이점이 있습니까? 보다 구체적으로, NN보다는 BNN에 더 적합한 예제를 제공 …

3
두 데이터 세트 간의 유사성 정량화
요약 : 가장 좋은 방법을 찾으려고 시도하면 단일 값을 사용하여 정렬 된 두 데이터 집합 간의 유사성을 요약합니다. 세부 사항 : 내 질문은 다이어그램으로 가장 잘 설명됩니다. 아래 그래프는 값이 각각 nf및로 표시된 두 개의 서로 다른 데이터 세트를 보여줍니다 nr. x 축의 점은 측정이 수행 된 위치를 나타내며 y …

3
부스팅 방법이 특이 치에 민감한 이유
부스팅 방법이 특이 치에 민감하다는 내용의 많은 기사를 찾았지만 그 이유를 설명하는 기사는 없습니다. 내 경험상 특이 치는 기계 학습 알고리즘에 좋지 않지만 부스팅 방법이 특히 민감한 것으로 분류되는 이유는 무엇입니까? 부스트 트리, 랜덤 포레스트, 신경망, SVM 및 로지스틱 회귀 분석과 같은 간단한 회귀 분석 방법은 특이 치에 대한 민감도 …

1
분산 분석 : 그룹당 샘플 수가 적은 많은 그룹의 정규성 가정 테스트
다음 상황을 가정하십시오. 우리는 작은 그룹 크기 (예 : n = 3)로 많은 수 (예 : 20)를 가지고 있습니다. 균일 분포에서 값을 생성하면 오차 분포가 균일하더라도 잔차가 거의 정상적으로 보입니다. 다음 R 코드는이 동작을 보여줍니다. n.group = 200 n.per.group = 3 x <- runif(n.group * n.per.group) gr <- as.factor(rep(1:n.group, each …

2
신뢰 구간은 실제로 모수 추정값의 불확실성을 측정합니까?
나는 통계 학자 윌리엄 브릭스 (William Briggs)의 블로그 게시물을 읽고 있었고, 다음 주장은 내가 가장 적게 말하는 것에 관심이 있었다. 무엇을 만드십니까? 신뢰 구간이란 무엇입니까? 물론 데이터 간격을 제공하는 방정식입니다. 모수 추정값의 불확실성에 대한 척도를 제공하기위한 것입니다. 이제 우리가 사실이라고 가정 할 수있는 빈번한 이론에 따르면, 당신이 가지고있는 CI에 대해 …

2
MCMC는 언제 유용합니까?
MCMC 접근 방식이 실제로 유용한 상황을 이해하는 데 어려움을 겪고 있습니다. 저는 Kruschke 저서 "Does Bayesian Data Analysis : A Tutorial with R and BUGS"의 장난감 예제를 보겠습니다. 내가 지금까지 이해 한 것은 P ( θ | D ) 의 표본을 가지기 위해서는 p(D|θ)p(θ)p(D|θ)p(θ)p(D|\theta)p(\theta) 에 비례하는 목표 분포가 필요하다는 것 …
12 mcmc 

2
행 확대를 사용하여 릿지 처벌 GLM?
능선 회귀는 원래 데이터 행렬에 데이터 행을 추가하여 달성 할 수 있다는 것을 읽었습니다. 여기서 각 행은 종속 변수의 경우 0을 사용하고 독립 변수 의 경우 제곱근 또는 0을 사용하여 구성됩니다. 그런 다음 각 독립 변수마다 하나의 추가 행이 추가됩니다.kkk 로지스틱 회귀 또는 다른 GLM을 포함하여 모든 경우에 대한 증거를 …


3
홀드 아웃 방법 (데이터를 교육 및 테스트로 분할)이 기존 통계에 사용되지 않는 이유는 무엇입니까?
교실에서 데이터 마이닝에 노출 할 때 모델 성능을 평가하는 방법으로 홀드 아웃 방법이 도입되었습니다. 그러나 선형 모델에서 첫 수업을 들었을 때 이것은 모델 검증 또는 평가의 수단으로 소개되지 않았습니다. 저의 온라인 조사에서도 교차점이 보이지 않습니다. 고전 통계에서 홀드 아웃 방법이 사용되지 않는 이유는 무엇입니까?

1
k- 평균 일명 확장 가능한 K- 평균 ++
Bahman Bahmani et al. k-means ++의 빠른 버전 인 k-means ||를 소개했습니다. 이 알고리즘은 그들의 논문 , Bahmani, B., Moseley, B., Vattani, A., Kumar, R. & Vassilvitskii, S. (2012)의 4 페이지에서 가져온 것입니다 . 확장 가능한 k- 평균 ++. VLDB 엔 다우먼트 절차 , 5 (7), 622-633. 불행히도 나는 그 …


1
jackknifing의 현대적인 사용이 있습니까?
문제 는 부트 스트랩이 잭 나이 핑보다 우수 합니다. 그러나 jackknifing이 모수 추정값의 불확실성을 특성화하기위한 유일하거나 최소한 가능한 옵션이 있는지 궁금합니다. 또한 실제 상황에서 부트 스트랩 핑과 관련하여 편향 / 정확성이 잭 니핑되는 방식은 무엇이며, 잭나이프 결과는보다 복잡한 부트 스트랩이 개발되기 전에 예비 통찰력을 제공 할 수 있습니까? 일부 상황 …

1
남자와 여자 체스 선수-분포의 꼬리에서 예상되는 불일치
2009 년이 논문의 결과에 관심이 있습니다. 왜 (최고의) 여자들이 체스를 잘하는가? 지적 영역의 참여율과 성별 차이 이 논문은 최고의 남자 체스 선수들이 왜 최고 여자 선수들보다 훨씬 더 나은 것처럼 보이는지 설명하려고 시도합니다 (여성들은 세계 최고의 1000 명의 선수 중 2 % 만 구성합니다). 특히 그들은 최고의 남자와 여자 체스 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.