통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

5
왜 선형 회귀를 연구해야합니까?
두 개의 랜덤 변수 와 가 주어지면 "상관 계수" 계산 하고이 두 랜덤 변수 사이에 가장 적합한 선을 형성 할 수 있습니다. 내 질문은 왜?η cξξ\xiηη\eta씨cc 1) 최악의 방법으로 의존하는 임의의 변수 및 가 있습니다 (예 : . 이 에도 불구하고 . 선형 회귀를 따라 생각하면 완전히 눈을 멀게됩니다.η ξ …
13 regression 

2
신경망에서 가중치를 초기화 할 때 잘린 정규 분포의 이점은 무엇입니까?
피드 포워드 신경망에서 연결 가중치를 초기화 할 때 학습 알고리즘이 중단되지 않는 대칭을 피하기 위해 무작위로 가중치를 초기화하는 것이 중요합니다. 다양한 장소에서 본 권장 사항 (예 : TensorFlow의 MNIST 자습서 )은 표준 편차 1 을 사용하여 잘린 정규 분포를 사용하는 것입니다 , 여기서N은 주어진 뉴런 레이어에 대한 입력 수입니다.1엔−−√1엔\dfrac{1}{\sqrt{N}}엔엔N 표준 …


1
잦은 조건부 추론이 실제로 사용되고 있습니까?
나는 최근에 Nancy Reid, Barndorff-Nielsen, Richard Cox의 오래된 논문을 검토했으며, 잦은 패러다임의 "조건부 추론"이라는 개념에 관한 작은 Ronald Fisher는 추론이 단지 전체 샘플 공간이 아니라 샘플 공간의 "관련 부분 집합". 주요 예로, 표본의 변동 계수 (보조 통계라고도 함)를 고려하면 t- 통계량을 기반으로하는 신뢰 구간을 개선 할 수 있습니다 (Goutis & …

1
Steve Hsu의 중국 천재 계산
물리학 자 Steve Hsu는 자신의 블로그 에서 다음과 같이 썼습니다. 정규 분포를 가정 할 때, 미국에는 + 4SD에서 수행하고 유럽에서 비슷한 숫자를 수행하는 사람은 약 10,000 명에 불과하므로 이는 상당히 많은 인구입니다 (대략 미국에서 매년 수백 명의 고등학생). NE 아시아 숫자를 13 억 명의 중국 인구에 외삽하면이 수준에서 30 만 …

1
심층 컨볼 루션 신경망에 유용한 데이터 확대 기술은 무엇입니까?
배경 : 저는 최근 Geoffrey Hinton의 훌륭한 연설을보고 컨볼 루션 신경망을 훈련 할 때 데이터 보강의 중요성에 대해 더 깊이 이해했습니다 . 그는 현재의 컨볼 루션 신경망은 테스트 대상 물체의 참조 프레임을 일반화 할 수 없으므로, 네트워크가 물체의 거울상이 동일하다는 것을 네트워크가 진정으로 이해하기 어렵게 만든다고 설명했다. 이 문제를 해결하기 …

2
잦은 결과로부터 베이지안 만들기
사전에 빈번한 결과를 베이지안으로 바꾸려면 어떻게해야합니까? 다음과 같은 일반적인 시나리오를 고려하십시오. 과거에 실험을 수행했으며 일부 매개 변수 에 대한 결과 가 측정되었습니다. 분석은 빈번한 방법론으로 수행되었습니다. 대한 신뢰 구간 이 결과에 제공됩니다.ϕϕϕ\phiϕϕ\phi 이제 및 와 같은 다른 매개 변수를 측정하려는 새로운 실험을 수행하고 있습니다. 내 실험은 이전 연구와 다릅니다 --- …

1
로그 정규 분포에서 산술 평균이 분포 평균보다 작은 이유는 무엇입니까?
그래서 로그 정규 분포 확률 변수 생성하는 무작위 프로세스가 있습니다. 해당 확률 밀도 함수는 다음과 같습니다.엑스XX 나는 원래 분포의 몇 순간의 분포 를 추정하고 싶었습니다 . 첫 번째 순간, 산술 평균이라고합시다. 그렇게하기 위해 10000 번의 랜덤 변수를 10000 번 그려서 산술 평균의 10000 추정치를 계산할 수있었습니다. 그 평균을 추정하는 두 …

1
로지스틱 회귀와 분수 반응 회귀의 차이점은 무엇입니까?
내가 아는 한, 로지스틱 모델과 분수 응답 모델 (frm)의 차이점은 frm이 [0,1]이지만 로지스틱이 {0, 1} 인 종속 변수 (Y)입니다. 또한 frm은 유사 가능성 추정기를 사용하여 모수를 결정합니다. 일반적으로로 glm로지스틱 모델을 얻는 데 사용할 수 있습니다 glm(y ~ x1+x2, data = dat, family = binomial(logit)). frm의 경우로 변경 family = binomial(logit)됩니다 …

1
메타 분석에서 효과 크기에 대한 사전 지정
내 질문은 효과 크기에 대한 사전에 관한 것이며, 프로젝트에서 측정 값은 Cohen 's 입니다. 문헌을 읽음으로써, 계층 적 베이지안 메타 분석의 잘 알려진 8 개 학교 예와 같이, 모호한 사전이 종종 사용되는 것처럼 보인다. 여덟 개의 학교 예에서, 나는 과 같이 mu 추정에 사용 된 모호한 것을 보았습니다 .μ θ …

1
소규모 데이터 세트에서 LSTM의 과적 합 방지
저는 80 차원의 word2vec와 같은 표현을 사용하여 128 개의 숨겨진 단위를 가진 단일 계층 LSTM을 사용하여 감정 예측에 대한 15000 트윗을 모델링하고 있습니다. 1 에포크 후 하강 정확도 (임의의 = 38 %로 38 %)를 얻습니다. 훈련 정확도가 높아질수록 검증 정확도가 떨어지기 시작합니다. 따라서 정규화 방법을 생각하고 있습니다. 숨겨진 단위 수를 …

4
상자 그림에서 히스토그램이 제공하지 않는 정보는 무엇입니까?
히스토그램은 변수의 분포를 잘 보여줍니다. 상자 그림은 같은 일을 시도하지만이 변수의 분포에 대한 그림을 제공하지는 않습니다. 사람들이 왜 상자 그림을 사용하는지 이해하지 못합니다. 히스토그램은 모든면에서 더 좋습니다. 둘 다 사용하는 이유가 있습니까? 박스 플롯이 제공하는 유일한 것은 : 이상치입니다! 어떤 관측치가 특이 치 일지 알려줍니다.

2
독립 표본 t- 검정 : 큰 표본 크기에 대해 데이터를 정규 분포로 분배해야합니까?
두 개의 독립 샘플이 다른 평균을 갖는지 테스트하고 싶다고 가정 해 봅시다. 나는 기본 분포가 정상 이 아니라는 것을 안다 . 올바르게 이해하면 테스트 통계가 평균 이며 표본 크기가 충분히 클 경우 표본이 아닌 경우에도 평균이 정상적으로 분포되어야합니다. 이 경우 모수 적 유의성 검정이 유효해야합니다. 나는 이것에 대해 상충되고 혼란스러운 …

2
데이터 마이닝에서 카오스 이론의 기존의 실제 적용은 무엇입니까?
지난 몇 년 동안 혼돈 이론에 대한 일부 대중 시장의 작품을 우연히 읽는 동안 신경망, 패턴 인식, 불확실성 관리 등과 같은 데이터 마이닝 및 관련 분야에 다양한 측면이 어떻게 적용될 수 있는지 궁금해지기 시작했습니다. 나는 출판 된 리서치에서 그러한 애플리케이션의 예를 거의 접하지 않았기 때문에 a) 실제로 알려진, 출판 된 …

3
기계 학습 모델 (GBM, NN 등)을 생존 분석에 어떻게 사용할 수 있습니까?
나는 Cox 비례 위험 회귀 및 일부 Kaplan-Meier 모델과 같은 전통적인 통계 모델을 사용하여 다음 사건이 발생할 때까지의 일을 실패 등으로 예측할 수 있습니다. 즉 생존 분석 질문 GBM, 신경망 등과 같은 기계 학습 모델의 회귀 버전을 사용하여 이벤트가 발생할 때까지 일을 어떻게 예측할 수 있습니까? 대상 변수로 발생까지 일을 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.