통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

10
모델을 구축하는 예측 이외의 이유는 무엇입니까?
Joshua Epstein은 "Why Model?"이라는 제목의 논문을 썼습니다. http://www.santafe.edu/media/workingpapers/08-09-040.pdf 에서 16 가지 이유 를 확인할 수 있습니다 . 설명 (예측과는 매우 다름) 가이드 데이터 수집 핵심 역학 조명 역동적 인 비유 제안 새로운 질문을 발견하십시오 과학적 사고 습관을 장려 가능한 범위로 바운드 (브래킷) 결과 핵심 불확실성을 밝힙니다. 거의 실시간으로 위기 옵션 …
11 modeling 

2
오디오 분류를위한 컨볼 루션 깊은 믿음 네트워크를 이해하는 방법?
"에서 계층 적 표현의 확장 성 자율 학습을위한 길쌈 깊은 믿음 네트워크 Lee 등으로". al. ( PDF ) Convolutional DBN이 제안되었습니다. 또한이 방법은 이미지 분류에 대해 평가됩니다. 작은 모서리와 가장자리 등과 같은 자연스러운 로컬 이미지 기능이 있으므로 논리적으로 들립니다. " Convolutional Deep Faith Networks를 이용한 오디오 분류를위한 비 감독 기능 …

3
MCMC 프로그램을 디버깅하는 표준 기술이 있습니까?
MCMC 프로그램을 디버깅하는 것은 매우 어렵습니다. 몇 가지 문제로 인해 어려움이 발생합니다. (a) 알고리즘의 주기적 특성 우리는 다른 모든 매개 변수에 조건부로 매개 변수를 반복적으로 그립니다. 따라서 구현이 제대로 작동하지 않으면 반복 샘플러의 어느 곳에 나 문제가있을 수 있으므로 버그를 격리하기가 어렵습니다. (b) 정답은 반드시 알려진 것은 아닙니다. 컨버전스를 달성했는지 …
11 mcmc 


2
기기와 변수 사이의 인과 관계가 중요합니까?
인과성 측면에서 도구 변수의 표준 체계 ->는 다음과 같습니다. Z -> X -> Y Z는 기기이고, X는 내생 변수이며, Y는 반응입니다. 다음과 같은 관계가 가능합니까? Z <- X ->Y Z <-> X ->Y 유효합니까? 기기와 변수의 상관 관계가 만족 스럽지만 이러한 경우 제외 제한을 어떻게 생각할 수 있습니까? 참고 : …

3
중심화가 공분산을 줄입니까?
두 개의 비 독립적 랜덤 변수가 있고 너무 많은 "신호"를 잃지 않고 가능한 한 변수 간의 공분산을 줄이고 싶다고 가정하면 센터링이 도움이됩니까? 나는 중심화가 의미있는 요인으로 상관 관계를 줄인다는 것을 어딘가 읽었으므로 공분산에 대해서도 동일하게 수행해야한다고 생각합니다.


4
상관 행렬의 제로 고유 값에 대한 충분하고 필요한 조건
확률 분포가 인 nnn 랜덤 변수 주어지면 상관 행렬 는 양의 반정의, 즉 고유 값입니다. 양수 또는 0입니다.XiXiX_iP(X1,…,Xn)P(X1,…,Xn)P(X_1,\ldots,X_n)Cij=E[XiXj]−E[Xi]E[Xj]Cij=E[XiXj]−E[Xi]E[Xj]C_{ij}=E[X_i X_j]-E[X_i]E[X_j] 가 제로 고유 값 을 갖기에 필요하거나 충분한 의 조건에 관심 이 있습니다 . : 예를 들어, 충분 조건은 확률 변수가 독립적이지 점이다 진짜 숫자 . 예를 들어, 다음 되고 고유 …

2
p- 노름 볼에서 균일 한 소음 발생 (
nnn 차원 의 p-norm 공에서 나오는 균일하게 분포 된 소음을 생성하는 함수를 작성하려고 합니다. ||x||p≤r||x||p≤r\begin{equation} ||x||_p \leq r \end{equation} 서클 ( ) ( http://mathworld.wolfram.com/DiskPointPicking.html )에 대한 가능한 해결책을 찾았 지만 p의 다른 값으로 확장하지 못했습니다 .p=2p=2p = 2ppp 균일 분포에서 임의의 샘플을 그리고 주어진 제약 조건을 충족하지 않으면 다시 그려서 …
11 simulation  noise 


2
MCMC 샘플러에 Jeffrey 또는 엔트로피 기반 사전을 사용하는 것에 대한 권장 사항이있는 이유는 무엇입니까?
에 자신의 위키 페이지 , 스탠 상태의 개발자 : 우리가 싫어하는 일부 원칙 : 불변성, Jeffreys, 엔트로피 대신 많은 정규 배포 권장 사항이 있습니다. 지금까지 샘플링에 의존하지 않는 베이지안 방법을 사용했는데 왜 는 이항 우도에 적합합니다.θ∼Beta(α=12,β=12)θ∼Beta(α=12,β=12)\theta \sim \text{Beta}\left(\alpha=\frac{1}{2},\beta=\frac{1}{2}\right)
11 bayesian  mcmc  prior  pymc  stan 

3
K- 평균 군집화를 초기화하는 방법
K- 평균의 초기 종자 (클러스터 센터)를 선택하는 현재의 최신 기술에 관심이 있습니다. 인터넷 검색은 두 가지 인기있는 선택으로 이어집니다. 초기 종자의 무작위 선택 및 KMeans ++ 선택 기법 사용 : Arthur & Vassilvitskii 2006 k-means ++ :주의 깊은 시딩의 장점 여기에 아무도 모르는 다른 유망한 방법이 있습니까?

1
SVM을 분류 확률로 해석하는 것이 왜 잘못 되었습니까?
SVM에 대한 나의 이해는 로지스틱 회귀 (LR)와 매우 유사하다는 것입니다. 즉, 가중 된 기능의 합이 시그 모이 드 함수에 전달되어 클래스에 속할 확률을 얻지 만 교차 엔트로피 (물리적) 손실 대신 기능, 훈련은 힌지 손실을 사용하여 수행됩니다. 힌지 손실을 사용하면 얻을 수있는 이점은 커널을보다 효율적으로 만들기 위해 다양한 수치 트릭을 수행 …

3
Nelder Mead의 기준 중지
함수 최적화를 위해 Nelder-Mead 알고리즘을 구현하려고합니다. Nelder-미드에 대한 위키 페이지 의 정지 기준을 제외하고, 전체 알고리즘에 대한 놀라 울 정도로 분명하다. 슬프게도 다음과 같이 말합니다. 수렴을 확인하십시오 [설명 필요] . 나는 두 가지 기준을 직접 시도하고 테스트했다. 중지하면 f(xN+1)−f(x1)&lt;ϵ에프(엑스엔+1)−에프(엑스1)&lt;ϵf(x_{N+1}) - f(x_1) < \epsilon 여기서 ϵϵ\epsilon 작고, 여기서 은 IS 번째 …

2
포장 된 트리 / 임의의 포리스트 트리가 단일 의사 결정 트리보다 높은 편향을 갖는 이유는 무엇입니까?
완전히 성장한 의사 결정 트리 (즉, 정리되지 않은 의사 결정 트리)를 고려하면 분산이 높고 편차가 적습니다. 배깅 및 랜덤 포레스트는 분산을 줄이고 예측 정확도를 높이기 위해 이러한 높은 분산 모델을 사용하고 집계합니다. 배깅 및 랜덤 포레스트는 모두 부트 스트랩 샘플링을 사용하며 "통계 학습 요소"에 설명 된대로 단일 트리에서 편향을 증가시킵니다. …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.