내가 읽는 일부 논문에 따르면 Jeffries와 Matusita 거리가 일반적으로 사용됩니다. 그러나 아래 공식을 제외하고는 그것에 대한 많은 정보를 찾을 수 없었습니다. JMD (x, y) =∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} 제곱근을 제외하고 유클리드 거리와 유사합니다. E (x, y) =∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} JM 거리는 분류 측면에서 유클리드 거리보다 신뢰할 수 있다고 주장됩니다. 왜이 차이가 JM 거리를 향상시키는 지 …
문제에 대한 해결책 : minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] X 의 중앙값으로 잘 알려져 XXX있지만 손실 함수는 다른 백분위 수에 어떤 모양입니까? 예 : X의 25 번째 백분위 수는 다음에 대한 솔루션입니다. minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] 이 경우 LLL 은 무엇입니까 ?
내 상황 : 작은 샘플 크기 : 116 이진 결과 변수 설명 변수의 긴 목록 : 44 설명 변수는 내 머리 꼭대기에서 나오지 않았습니다. 그들의 선택은 문헌에 근거했다. 대부분의 경우 샘플과 대부분의 변수에 결 측값이 있습니다. 선택된 기능 선택에 접근 : LASSO R의 glmnet 패키지는 데이터 세트에 누락 된 값이 …
Markov Chain Monte Carlo 방법을 연구해야합니다.보다 구체적으로 Metropolis Hastings 알고리즘과 수렴 기준과 같은 모든 것을 연구해야합니다. 이 용어를 간단한 용어로 설명하지만 사소한 것이 아니라 책, 논문 또는 웹 사이트를 누가 처방 할 수 있습니까?
로지스틱 회귀를 R사용할 수 있습니다. glm(y ~ x, family=binomial(logit))) 그러나 IIUC는 로그 가능성을 최적화합니다. 선형 ( ) 손실 함수 (이 경우 총 변동 거리 와 동일)를 사용하여 모델을 학습하는 방법 이 있습니까?L1L1L_1 즉, 숫자 벡터 주어진 및 비트 (논리) 벡터 , I는 (증가하는 사실)를 단조 함수를 생성하고자 되도록최소화됩니다.y f ∑ …
나는 두 개의 임의 변수의 공분산을 더 잘 이해하고 그것을 처음 생각한 사람이 통계에서 일상적으로 사용되는 정의에 어떻게 도달했는지 이해하려고 노력했습니다. 나는 그것을 더 잘 이해하기 위해 위키 백과 에 갔다 . 이 기사에서 대한 올바른 후보 측정 또는 수량 은 다음과 같은 속성을 가져야합니다.씨o v ( X, Y)Cov(X,Y)Cov(X,Y) 두 …
로지스틱 회귀 분석에서 연속 변수의 승산 비를 해석하는 방법에 대한 몇 가지 질문이 있습니다. 나는 이것이 로지스틱 회귀에 대한 기본적인 질문 인 것처럼 느끼고 아마도 회귀에 대해 알지 못한다는 것이 약간 부끄럽지만, 자부심을 삼켜 서 물어볼 것입니다. 미래! 여기 내 상황이 있습니다. 저는 집행 유예의 일환으로 직업 / 생활 기술 …
보험 위험 예측 모델을 개발 중입니다. 이 모델은 항공사 노쇼 예측, 하드웨어 오류 감지 등과 같은 "희귀 이벤트"입니다. 데이터 세트를 준비 할 때 분류를 적용하려고했지만 부정적인 사례가 많기 때문에 유용한 분류기를 얻을 수 없었습니다. . 고등학교 통계 과정 이외의 통계 및 모델링 데이터에 대한 경험이 많지 않아 다소 혼란 스럽습니다. …
1000 개의 양성으로 100,000 개의 관측치 (9 개의 더미 표시기 변수)가 있습니다. 이 경우에는 로지스틱 회귀가 잘 작동하지만 컷오프 확률은 당황합니다. 일반적인 문헌에서는 1과 0을 예측하기 위해 50 % 컷오프를 선택합니다. 내 모델의 최대 값이 ~ 1 %이므로이 작업을 수행 할 수 없습니다. 따라서 임계 값은 0.007 또는 그 주위에있을 …
바이너리 데이터 (0-1 항목 만)의 큰 (650K 행 * 62 열) 행렬이 있습니다. 매트릭스는 대부분 희박합니다. 약 8 %가 채워집니다. 1에서 5로 명명 된 5 개의 그룹으로 클러스터링하고 싶습니다. 계층 적 클러스터링을 시도했지만 크기를 처리 할 수 없었습니다. 또한 길이 62의 650K 비트 벡터를 고려하여 해밍 거리 기반 k- 평균 …
표준 오류를 어디에서나 이끌어내는 일반적인 방법을 찾지 못하는 것 같습니다. 나는 구글,이 웹 사이트 및 심지어 교과서에서도 보았지만 찾을 수있는 모든 것은 평균, 분산, 비율, 위험 비율 등에 대한 표준 오류 공식이며 공식이 어떻게 도착했는지는 아닙니다. 몸이 간단한 용어로 설명하거나 그것을 설명하는 좋은 자료로 연결시킬 수 있다면 나는 감사 할 …