통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
확률 밀도 함수의 변수 변화의 유도?
책 패턴 인식 및 기계 학습 (공식 1.27)에서 피와이( y) = p엑스( x ) ∣∣∣디엑스디와이∣∣∣= p엑스( g( y) ) | 지'( y) |피와이(와이)=피엑스(엑스)|디엑스디와이|=피엑스(지(와이))|지'(와이)|p_y(y)=p_x(x) \left | \frac{d x}{d y} \right |=p_x(g(y)) | g'(y) | 여기서 , 는 변수의 변경과 관련하여 해당하는 pdf입니다 .x = g( y)엑스=지(와이)x=g(y)피엑스( x )피엑스(엑스)p_x(x)피와이( y)피와이(와이)p_y(y) 이 책은 …

2
ROC 곡선 아래의 정확도 대 면적
진단 시스템을위한 ROC 곡선을 구성했습니다. 곡선 아래 면적은 비모수 적으로 AUC = 0.89 인 것으로 추정되었다. 최적의 임계 값 설정 (점 (0, 1)에 가장 가까운 지점)에서 정확도를 계산하려고 할 때 진단 시스템의 정확도는 0.8로 AUC보다 작습니다! 최적의 임계 값과는 다른 다른 임계 값 설정에서 정확도를 확인했을 때 정확도는 0.92와 같습니다. …

1
부분 최소 제곱, 감소 된 순위 회귀 및 주요 구성 요소 회귀 간의 연결은 무엇입니까?
감소 된 순위 회귀 및 주성분 회귀는 부분 최소 제곱의 특별한 경우입니까? 이 튜토리얼 (6 페이지의 "목표 비교")에서는 X 또는 Y를 투영하지 않고 부분 최소 제곱을 수행 할 때 (즉, "부분이 아님") 해당 등급이 감소하거나 주성분 회귀가 감소한다고 설명합니다. 이 SAS 설명서 페이지 , "감소 된 순위 회귀"및 "방법 간의 …



3
최대 가능성은 언제 작동합니까?
예를 들어 산술 평균 계산과 비교할 때 최대 우도 방법에 대해 혼란 스럽습니다. 최대 가능성이 언제 그리고 왜 산술 평균보다 "더 나은"추정치를 생성합니까? 어떻게 확인할 수 있습니까?

1
음이 아닌 제로 팽창 연속 데이터를 모델링하는 방법은 무엇입니까?
현재 family = gaussian0보다 낮은 값을 가질 수 없으며 0으로 팽창하고 연속적 인 생물 다양성의 지표에 선형 모델 ( ) 을 적용하려고합니다 . 값의 범위는 0에서 0.25를 약간 상회합니다. 결과적으로, 내가 제거하지 못한 모델의 잔차에는 분명한 패턴이 있습니다. 누구든지 이것을 해결하는 방법에 대한 아이디어가 있습니까?

2
분산의 선형성
다음 두 가지 공식이 사실이라고 생각합니다. Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) a는 상수이고 경우, , 독립적Var(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) XXXYYY 그러나 아래에 어떤 문제가 있는지 잘 모르겠습니다. Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + \mathrm{Var}(X) 같지 않음 , 즉 입니다.4 V a r ( X )22Var(X)22Var(X)2^2 \mathrm{Var}(X)4Var(X)4Var(X)4\mathrm{Var}(X) 이 것을 가정하면 인구에서 가져온 샘플입니다, …

3
판별 분석 대 로지스틱 회귀
판별 분석에 대한 전문가를 찾았으며 이에 대한 질문이 있습니다. 그래서: 클래스가 잘 분리되면 로지스틱 회귀에 대한 모수 추정값이 놀랍게 불안정합니다. 계수가 무한대로 될 수 있습니다. LDA는이 문제로 고통받지 않습니다. 피처 수가 적고 예측 변수 의 분포가 각 클래스에서 대략 정규이면 선형 판별 모델은 로지스틱 회귀 모델보다 더 안정적입니다.엑스엑스X 안정성이란 무엇이며 …


1
통계 학습 이론에서 테스트 세트에 과적 합의 문제가 있습니까?
MNIST 데이터 세트 분류에 대한 문제점을 고려해 봅시다. Yann LeCun의 MNIST 웹 페이지 에 따르면 'Ciresan et al.' Convolutional Neural Network를 사용하여 MNIST 테스트 세트에서 0.23 % 오류율을 얻었습니다. MNIST 교육 세트를 , MNIST 테스트 세트를 , 을 로 사용하여 얻은 최종 가설 및 을 사용하여 MNIST 테스트 세트에 대한 …

1
가중 랜덤 포레스트를위한 R 패키지? classwt 옵션?
랜덤 포레스트를 사용하여 매우 불균형 한 데이터 세트의 결과를 예측하려고합니다 (소수 클래스 비율은 약 1 % 이하입니다). 기존의 랜덤 포레스트 알고리즘은 소수 클래스에 특별한주의를 기울이지 않고 전체 오류율을 최소화하므로 불균형 데이터에는 직접 적용 할 수 없습니다. 따라서 소수 민족의 오 분류 (비용에 민감한 학습)에 높은 비용을 할당하고 싶습니다. R 에서 …
16 r  random-forest 

3
분포는 정확히 무엇입니까?
나는 확률과 통계에 대해 거의 알지 못하고 배우고 싶습니다. 나는 "배포"라는 단어가 다른 상황에서 사방에 사용 된 것을 본다. 예를 들어, 이산 랜덤 변수에는 "확률 분포"가 있습니다. 나는 이것이 무엇인지 안다. 연속 확률 변수는 들어, 확률 밀도 함수를 갖는 적분에서 에 확률 밀도 함수에서 평가 누적 분포 함수이고 .x∈Rx∈Rx\in\mathbb{R}−∞−∞-\inftyxxxxxx 그리고 …

2
카이-제곱 적합도 테스트를위한 사후 테스트
세 가지 범주로 카이-제곱 적합도 (GOF) 테스트를 수행하고 있으며 특히 각 범주의 모집단 비율이 같은지 (예 : 비율이 각 그룹의 1/3 임) null을 테스트하려고합니다. 관찰 된 데이터 그룹 1 그룹 2 그룹 3 총계 686928 1012 2626 따라서이 GOF 테스트의 경우 예상 카운트는 2626 (1/3) = 875.333이며 테스트 는 <0.0001 …

3
충분한 통계량에 모수 추정값을 계산하는 데 필요한 모든 정보가 포함되는 이유는 무엇입니까?
방금 통계를 공부하기 시작했고 충분하다고 직관적으로 이해할 수 없습니다. 더 정확하게 말하면 다음 두 단락이 동일하다는 것을 보여주는 방법을 이해할 수 없습니다. 대략, 알 수없는 모수 θ로 조절 된 독립적으로 동일하게 분포 된 데이터의 세트 X가 주어지면, 충분한 통계량은 그 값에 모수의 추정치를 계산하는 데 필요한 모든 정보가 포함 된 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.