통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
CNN xavier 가중치 초기화
일부 자습서에서는 "Xavier"가중치 초기화 (서류 : 딥 피드 포워드 신경망 훈련의 어려움 이해 )가 신경망의 가중치를 초기화하는 효율적인 방법 이라는 것을 알았습니다 . 완전히 연결된 레이어의 경우이 튜토리얼에서 경험할 규칙이 있습니다. Va r ( W) = 2엔나는 n+ nO U t,더 간단한 대안 :Va r ( W) = 1엔나는 nVㅏ아르 …

3
AUC의 확률 론적 해석을 도출하는 방법은 무엇입니까?
ROC 곡선 아래의 영역이 분류자가 무작위로 선택된 "긍정적 인"인스턴스 (검색된 예측에서)를 무작위로 선택한 "긍정적 인"인스턴스 (원래의 긍정적 인 클래스에서)보다 높은 순위로 순위를 매기는 이유는 무엇입니까? 적분을 사용하여 수학적으로이 진술을 어떻게 증명하고 CDF와 PDF에 진정한 양수 분포와 음수 분포를 제공합니까?
14 probability  roc  auc 


2
분포의 평균에 대한 순간 직감?
누군가가 왜 세 번째와 네 번째 모멘트와 같이 확률 분포 의 더 높은 모멘트 가 왜도 및 첨도에 해당 하는지에 대한 직감을 제공 할 수 있습니까 ? 구체적으로, 왜 세 번째 또는 네 번째 거듭 제곱으로 올린 평균에 대한 편차가 왜도 및 첨도의 척도로 변환 되는가? 이것을 함수의 3 차 …


3
Naive Bayes에서 log-sum-exp 트릭이 작동하는 예
나는 많은 곳에서 log-sum-exp 트릭에 대해 읽었 지만 (예를 들어 here 와 here ) 이것이 Naive Bayes 분류기에 어떻게 적용되는지에 대한 예를 보지 못했습니다 (예 : 개별 기능과 두 클래스) 이 트릭을 사용하여 수치 언더 플로 문제를 어떻게 정확하게 피할 수 있습니까?


6
MLE vs MAP 추정, 언제 사용합니까?
MLE = 최대 가능성 추정 MAP = 사후 최대 MLE는 매개 변수가 주어진 관측 확률 (즉, 우도 함수) 로만 시작 하고 관측치에 가장 잘 맞는 매개 변수를 찾으려는 점에서 직관적 / 순진 합니다 . 그러나 사전 지식은 고려하지 않습니다. MAP는 베이 즈 규칙을 통한 사전 지식을 고려하기 때문에보다 합리적으로 보입니다. …

2
로지스틱 회귀 분석의 과대 산포
로지스틱 회귀 분석의 과대 산포 개념을 다루려고합니다. 과분 산은 반응 변수의 분산이 이항 분포에서 예상되는 것보다 클 때 관찰됩니다. 그러나 이항 변수에 두 개의 값 (1/0) 만있을 수있는 경우 어떻게 평균과 분산을 가질 수 있습니까? 나는 x 번의 Bernoulli 시행에서 성공의 평균과 분산을 계산하는 것이 좋습니다. 그러나 두 가지 값만 …

2
교차 검증 및 파라미터 최적화
10 배 교차 검증을 사용할 때 매개 변수 최적화에 대한 질문이 있습니다. 모든 접기 모델 훈련 중에 매개 변수를 수정해야하는지 여부를 묻고 싶습니다. 즉 (1) 모든 접기의 평균 정확도에 대해 최적화 된 매개 변수 집합을 하나 선택합니다. 또는 (2) 모든 접기마다 최적화 된 매개 변수를 찾은 다음 모든 접기마다 다른 …

1
bca 방법을 사용하여 신뢰 구간을 계산할 때 R 부트 패키지에서 "추정 조정 'a'는 NA입니다"라는 오류가 발생하는 이유는 무엇입니까?
dput을 사용하여 여기에 업로드 한 숫자 벡터가 있습니다 (... / code / MyData.Rdata). bca ci를 얻고 싶습니다.이 코드를 작성했습니다. my.mean <- function(dat, idx){ return (mean(dat[idx], na.rm = TRUE)) } boot.out<-boot(data=my.data, statistic = my.mean, R=1000) 그러나 다음을 실행하면이를 얻습니다. > boot.ci(boot.out) Error in bca.ci(boot.out, conf, index[1L], L = L, t = …
14 r  bootstrap 

3
다변량 모드의 계산 효율적인 계산
짧은 버전 : 연속 분포에서 샘플링 된 다차원 데이터 세트의 모드를 추정하는 가장 계산 효율적인 방법은 무엇입니까? 긴 버전 : 모드를 추정 해야하는 데이터 세트가 있습니다. 이 모드는 평균 또는 중앙값과 일치하지 않습니다. 샘플은 다음과 같습니다. 2D 예이지만 ND 솔루션이 더 좋습니다. 현재 내 방법은 원하는 모드의 해상도와 동일한 그리드에서 …

2
R에서 생존 확률 추정
생존 시간 샘플을 기반으로 , Kaplan-Meier 추정기를 사용하여 특정 대해 생존 시간 의 확률을 추정하고 싶습니다 . 이 작업을 수행 할 수 있습니까? 그주의 반드시 이벤트 시간이 아닙니다.nnnttttttRttt
14 r  kaplan-meier 

1
단측 신뢰 구간의 적용 범위가 95 % 일 수 있습니까
알파 수준이 1 인 단측 (단일) 가설이 주어지면 궁금합니다. 95 % 신뢰 구간에.05 대해 이야기 할 수 있습니까? 예를 들어, 단측 Z 또는 t 검정에 대해 " 단면" 및 "양면"신뢰 구간 을 별도로 구성 할 수 있습니까? 단측 검정에서 이러한 각 신뢰 구간 의 "해석"은 무엇입니까? 나는 이것에 대해 약간 …

2
시끄러운 레이블로 분류?
분류를 위해 신경망을 훈련하려고하지만 레이블이 다소 시끄 럽습니다 (라벨의 약 30 %가 잘못되었습니다). 교차 엔트로피 손실이 실제로 작동하지만이 경우 더 효과적인 대안이 있는지 궁금합니다. 또는 교차 엔트로피 손실이 최적입니까? 확실하지는 않지만 교차 엔트로피 손실을 어느 정도 "클리핑"하여 하나의 데이터 포인트에 대한 손실이 상한보다 크지 않을 것이라고 생각하고 있습니까? 감사! 업데이트 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.