통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
전력이 매우 낮은 "비밀"통계 테스트가 있습니까?
배경 컴퓨터 과학, 수학 및 때로는 다른 분야에서 "비공식적 인"예는 재미있을뿐만 아니라 특정 개념을 설명하는 데 도움이됩니다. Bogosort 및 Slowsort 는 특히 다른 정렬 알고리즘과 비교할 때 알고리즘의 속성을 이해하는 데 사용할 수있는 매우 비효율적 인 정렬 알고리즘입니다. 밀교 프로그래밍 언어 는 프로그래밍 언어 의 개념이 얼마나 광범위한지를 보여주고 좋은 …

2
KKT를 사용하여
참고 문헌에 따르면 1 권 , 2 권 과 종이 . 정규화 된 회귀 (Ridge, LASSO 및 Elastic Net)와 제약 조건 간에는 동등한 내용이 언급되어 있습니다. Cross Validated 1 및 Cross Validated 2 도 살펴 보았지만 그 동등성 또는 논리에 대한 명확한 답변을 볼 수는 없습니다. 내 질문은 Karush–Kuhn–Tucker (KKT)를 …

2
Gibbs 샘플링은 MCMC 방법입니까?
내가 이해하는 한 그것은 (적어도 Wikipedia가 그것을 정의 하는 방법입니다 ). 그러나 나는 Efron * (강조 추가)에 의해이 진술을 찾았습니다. Markov 체인 Monte Carlo (MCMC)는 현대 베이지안 통계의 성공 사례입니다. MCMC와 자매 방법 인 "Gibbs sampling" 은 분석 표현에 비해 너무 복잡한 상황에서 사후 분포의 수치 계산을 허용합니다. 그리고 지금 …
11 mcmc  gibbs 

4
가능성이없는 추론-무슨 뜻입니까?
최근에 나는 문헌에서 '무우 행 (freelihood-free)'방법이 사용되는 것을 알고있다. 그러나 나는 그것이 될 추론 또는 최적화 방법에 대해 무엇을 의미하는지에 취소하고 있지 않다 가능성이없는 . 기계 학습에서 목표는 보통 신경망의 가중치와 같은 기능에 맞는 일부 매개 변수의 가능성을 최대화하는 것입니다. 그렇다면 가능성이없는 접근법 의 철학은 정확히 무엇이며 GAN과 같은 적대적인 …

5
신뢰 구간이 유용합니까?
잦은 통계에서 95 % 신뢰 구간은 무한 횟수 반복 될 경우 시간의 실제 매개 변수 95 %를 포함하는 구간 생성 절차입니다. 이것이 왜 유용한가요? 신뢰 구간은 종종 오해됩니다. 매개 변수가 95 % 확신 할 수있는 구간 이 아닙니다 (유사한 베이지안 신뢰 구간을 사용하지 않는 한). 신뢰 구간은 미끼와 같은 느낌입니다. …

5
정보를 빌린다는 것은 정확히 무엇을 의미합니까?
나는 종종 사람들이 베이지안 계층 모델에서 정보 차용 또는 정보 공유에 대해 이야기합니다. 이것이 실제로 무엇을 의미하는지, 이것이 베이지안 계층 모델에 고유한지에 대한 직접적인 대답을 얻을 수없는 것 같습니다. 나는 일종의 아이디어를 얻습니다. 계층의 일부 수준은 공통 매개 변수를 공유합니다. 나는 이것이 어떻게 "정보 차용"으로 해석되는지 전혀 모른다. "정보 차용"/ …

1
불균형 데이터 셋 생성
훈련 된 모델을 불균형 데이터 세트에서 테스트하고 싶습니다. 균형 레이블이 지정된 데이터 집합 (스팸 / 스팸이 아닌)에서 합성 데이터를 생성하는 데 사용할 수있는 알고리즘이 있습니까?

2
적절한 사전 및 지수 가능성은 부적절한 후부로 이어질 수 있습니까?
(이 질문은 Xi'an 의이 의견 에서 영감을 얻었습니다 .) 이전 분포 가 적절하고 가능성 이 잘 정의되어 있으면 사후 분포 은 거의 확실합니다.π(θ)π(θ)\pi(\theta)L(θ|x)L(θ|x)L(\theta | x)π(θ|x)∝π(θ)L(θ|x)π(θ|x)∝π(θ)L(θ|x)\pi(\theta|x)\propto \pi(\theta) L(\theta|x) 경우에 따라 강화 또는 지수화 가능성을 대신 사용하여 의사-후 위로 이어집니다. π~(θ|x)∝π(θ)L(θ|x)απ~(θ|x)∝π(θ)L(θ|x)α\tilde\pi(\theta|x)\propto \pi(\theta) L(\theta|x)^\alphaα>0 일부 (예 : 계산상의 이점이있을 수 있음).α>0α>0\alpha>0 이 설정에서는 …


2
CNN은 왜 FC 레이어로 결론을 내립니까?
내 이해에서 CNN은 두 부분으로 구성됩니다. 특징 추출을 수행하는 첫 번째 부분 (conv / pool layer)과 특징으로부터 분류를 수행하는 두 번째 부분 (fc layer). 완전히 연결된 신경망은 최고의 분류기 (예 : 대부분 SVM 및 RF에 의해 성능이 뛰어남)가 아니기 때문에 왜 CNN이 SVM 또는 RF가 아니라 FC 레이어로 결론을 내립니까?

1
표본의 산술 평균이 동일한 분포를 따르는 Cauchy 이외의 분포가 있습니까?
가 Cauchy 분포를 따르는 경우 도 와 정확히 동일한 분포를 따릅니다 . 이 스레드를 참조하십시오 .XXXY=X¯=1n∑ni=1XiY=X¯=1n∑i=1nXiY = \bar{X} = \frac{1}{n} \sum_{i=1}^n X_iXXX 이 숙박 시설에 이름이 있습니까? 이것이 사실 인 다른 배포판이 있습니까? 편집하다 이 질문을하는 또 다른 방법 : 를 확률 밀도 갖는 랜덤 변수 라고하자 .XXXf(x)f(x)f(x) 하자 , …

4
통계에서 데시벨 사용
나는 RFID 태그를 읽고 안테나 구성 (안테나 수, 위치 등)을 변경할 때 독자가 보는 신호 강도를 비교하는 프로젝트를 진행하고 있습니다. 프로젝트의 일환으로 설정을 비교하여 가장 효과적인 것을 확인해야합니다. 이상적으로, 나는 Unpaired t-Test 또는 두 안테나 위치 사이의 분산 분석 (또는 다중 사이의 MANOVA)을 수행 할 수 있습니다. 그러나 응답이 로그인 …

3
이산 랜덤 변수의 속성
내 통계 과정은 이산 랜덤 변수에 유한 옵션 이 있다는 것을 가르쳐주었습니다 ... 나는 그것을 몰랐습니다. 정수 세트처럼 무한 할 수 있다고 생각했을 것입니다. 대학 과정의 일부를 포함하여 여러 웹 페이지를 인터넷으로 확인하고 확인한 결과이를 구체적으로 확인하지 못했습니다. 그러나 대부분의 사이트는 불연속 랜덤 변수가 셀 수 있다고 말합니다. 유한 한 …

3
데이터가 선형이 아닌 경우 선형 회귀가 중요 할 수 있습니까?
선형 회귀 분석을 수행하여 중요한 결과를 얻었지만 산점도에서 선형성을 검사했을 때 데이터가 선형임을 확신하지 못했습니다. 산점도를 검사하지 않고 선형성을 테스트하는 다른 방법이 있습니까? 선형 회귀가 선형이 아닌 경우 중요 할 수 있습니까? [산점도를 포함하도록 편집]
11 regression 


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.