통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
실제로 Kullback-Leibler Divergence를 계산 하시겠습니까?
나는 2 사이의 비 유사성 척도로 KL 분기를 사용하고 있습니다. m . f . p.m.f.p.m.f.p.m.f. PPP 와 QQQ . =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi)DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) 경우 그리고, 우리는 쉽게 그 계산할 수 P(Xi)=0P(Xi)=0P(X_i)=0P(Xi)ln(Q(Xi))=0P(Xi)ln(Q(Xi))=0P(X_i)ln\left(Q(X_i)\right)=0 P(Xi)ln(P(Xi))=0P(Xi)ln(P(Xi))=0P(X_i)ln\left(P(X_i)\right)=0 그러나 및 를 계산하는 방법P(Xi)≠0P(Xi)≠0P(X_i)\ne0Q(Xi)=0Q(Xi)=0Q(X_i)=0P(Xi)ln(Q(Xi))P(Xi)ln(Q(Xi))P(X_i)ln\left(Q(X_i)\right)

1
순도를 계산하는 방법?
군집 분석에서 순도는 어떻게 계산합니까? 방정식은 무엇입니까? 나는 그것을 위해 그것을 할 코드를 찾고 있지 않다. ωkωk\omega_k 를 군집 k로하고 cjcjc_j 를 클래스 j로 하자 . 순도는 실제로 정확도입니까? 샘플 크기에 대해 클러스터 당 실제로 분류 된 클래스의 양을 합한 것 같습니다. 방정식 소스 문제는 출력과 입력 사이의 관계는 무엇입니까? …
15 clustering 

4
고정 효과 모델에서 시간 불변 변수를 유지하는 방법
10 년 동안 이탈리아의 한 대기업 직원에 대한 데이터를 보유하고 있으며 시간이 지남에 따라 남성과 여성의 소득 차이가 어떻게 변했는지보고 싶습니다. 이를 위해 풀링 된 OLS를 실행합니다. 연간 로그 이익이다는 개인과 시간 차이 공변량 포함 년 인형하고 있습니다 근로자가 남성이고, 그렇지 않으면 0 인 경우 중 하나에 해당합니다.yit=X′itβ+δmalei+∑t=110γtdt+εityit=Xit′β+δmalei+∑t=110γtdt+εit y_{it} = …

2
연속 및 이진 데이터를 선형 SVM과 혼합합니까?
그래서 나는 SVM을 가지고 놀고 있었고 이것이 좋은 일인지 궁금합니다. 연속 기능 (0 ~ 1) 세트와 더미 변수로 변환 된 범주 기능 세트가 있습니다. 이 특별한 경우에는 측정 날짜를 더미 변수로 인코딩합니다. 데이터를 보유한 기간은 3 가지이며 3 개의 기능 번호를 예약했습니다. 20:21:22 : 따라서 데이터가 나오는 기간에 따라 다른 …

1
다변량 생물학적 시계열 : VAR 및 계절성
생물학적 및 환경 변수 상호 작용 (및 일부 외생 변수)을 포함하는 다변량 시계열 데이터 세트가 있습니다. 계절성 외에도 데이터에 명확한 장기 추세는 없습니다. 내 목적은 어떤 변수가 서로 관련되어 있는지 확인하는 것입니다. 예측은 실제로 찾지 못했습니다. 시계열 분석을 처음 접했을 때 몇 가지 참조를 읽었습니다. 내가 이해하는 한, VAR (Vector …

1
상호 엔트로피 란 무엇인가
이 질문 은 수식의 관점에서 교차 엔트로피의 정량적 정의를 제공합니다. 위키피디아는보다 명쾌한 정의를 찾고 있습니다. 정보 이론에서, 두 확률 분포 사이의 교차 엔트로피 는 "진정한"분포 p가 아니라 주어진 확률 분포 q에 기초하여 코딩 방식이 사용되는 경우, 가능성 세트로부터 이벤트를 식별하는데 필요한 평균 비트 수를 측정한다 . 나는 이것을 이해하는데 어려움을 …

1
왜 glmer (family = binomial) 출력을 Gauss-Newton 알고리즘의 수동 구현과 일치시킬 수 없습니까?
lmer (실제로 glmer)의 출력을 장난감 이항 예제와 일치시키고 싶습니다. 나는 삽화를 읽었고 무슨 일이 일어나고 있는지 이해한다고 믿는다. 그러나 분명히 나는하지 않습니다. 막힌 후, 나는 무작위 효과의 관점에서 "진실"을 고쳤으며, 고정 된 효과 만 추정 한 후에 갔다. 아래 에이 코드를 포함시킵니다. 그것이 합법적임을 알기 위해 주석을 달아 + Z …

1
코시 분포와 중앙 한계 정리
CLT를 유지하려면 평균 μμ\mu 및 유한 분산 를 갖도록 근사하려는 분포가 필요합니다 σ2σ2\sigma^2. 코시 분포 (Cauchy distribution)의 경우, 평균과 분산이 정의되지 않은 경우, 중앙 한계 정리 (Central Limit Theorem)는 무증상으로도 좋은 근사치를 제공하지 못한다고 말할 수 있습니까?


1
여러 선형 모델에서 관계를 시각적으로 표현하는 가장 좋은 방법
저는 약 6 개의 예측 변수가있는 선형 모형을 가지고 있으며 추정치, F 값, p 값 등을 제시 할 것입니다. 그러나 단일 예측 변수의 개별 효과를 나타내는 가장 좋은 시각적 도표가 무엇인지 궁금했습니다. 응답 변수? 산포도? 조건부 플롯? 효과도? 기타? 그 음모를 어떻게 해석합니까? R 에서이 작업을 수행하므로 가능하면 예제를 자유롭게 …

1
로지스틱 함수의 헤 시안
가 다음과 같은 로지스틱 회귀 분석에서 목적 함수 의 Hessian을 도출하는 데 어려움이 있습니다 . : l(θ)l(θ)l(\theta)l(θ)l(θ)l(\theta)l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))]l(θ)=∑i=1m[yilog⁡(hθ(xi))+(1−yi)log⁡(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] hθ(x)hθ(x)h_\theta(x) 는 로지스틱 함수입니다. 헤 시안은 입니다. I가 계산하여 도출하려고 하지만 다음은 행렬 표기법으로 얻는 방법을 그다지 명백하지 않았다 .XTDXXTDXX^T D X ∂2l(θ)∂2l(θ)∂θi∂θj∂2l(θ)∂θi∂θj\frac{\partial^2 …
15 logistic 

3
온라인 학습의 정규화 및 기능 확장?
로지스틱 회귀 분류 기가 있다고 가정 해 봅시다. 일반적인 배치 학습에서는 과적 합을 방지하고 체중을 작게 유지하는 정규화 용어가 있습니다. 또한 기능을 정규화하고 확장합니다. 온라인 학습 환경에서 지속적인 데이터 스트림을 받고 있습니다. 각 예제에서 그라디언트 하강 업데이트를 수행 한 다음 버립니다. 온라인 학습에서 기능 스케일링 및 정규화 용어를 사용해야합니까? 그렇다면 …

2
MCMC Metropolis-Hastings 변형과 혼동 : Random-Walk, Non-Random-Walk, Independent, Metropolis
지난 몇 주 동안 저는 MCMC와 Metropolis-Hastings 알고리즘을 이해하려고 노력했습니다. 내가 그것을 이해할 때마다 나는 내가 틀렸다는 것을 깨닫는다. 내가 찾은 대부분의 코드 예제는 설명과 일치하지 않는 것을 구현합니다. 즉, 그들은 Metropolis-Hastings를 구현한다고 말하지만 실제로는 랜덤 워크 대도시를 구현합니다. 다른 것들은 (거의 항상) 대칭 제안 분포를 사용하고 있기 때문에 헤이스팅스 …

4
R의 ARIMA 잔차에 대한 Ljung-Box 통계 : 혼란스러운 테스트 결과
계절 ARIMA (0,0,0) (0,1,0) [12] 모델 (= fit2)을 사용하여 예측하려고하는 시계열이 있습니다. R이 auto.arima로 제안한 것과는 다릅니다 (R 계산 된 ARIMA (0,1,1) (0,1,0) [12]가 더 적합 할 것입니다. 그러나 내 시계열의 지난 12 개월 동안 내 모델 (fit2)이 조정될 때 더 잘 맞는 것 같습니다 (만성적으로 편향된 경우, 잔차 평균을 …

5
로지스틱 회귀 분석은 비모수 검사입니까?
최근 이메일을 통해 다음과 같은 질문을 받았습니다. 아래에 답변을 게시하지만 다른 사람들의 의견을 듣고 싶습니다. 로지스틱 회귀 분석을 비모수 적 테스트라고 하시겠습니까? 데이터가 정상적으로 분포되어 있지 않기 때문에 테스트 비모수에 레이블을 지정하는 것만으로는 충분하지 않습니다. 그것은 가정의 부족과 관련이 있습니다. 로지스틱 회귀에는 가정이 있습니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.