통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
평균 0 및 표준 편차 1 분포가 항상 사용되는 이유는 무엇입니까?
내 통계는 자체적으로 가르쳐졌지만 읽은 많은 자료는 평균 0과 표준 편차가 1 인 데이터 세트를 가리 킵니다. 이 경우 다음과 같습니다. 평균 0과 SD 1이 좋은 특성 인 이유는 무엇입니까? 이 표본에서 추출한 임의 변수가 0.5 인 이유는 무엇입니까? 0.001을 그릴 확률은 0.5와 동일하므로 평평한 분포 여야합니다. 사람들이 Z 점수에 …

2
과대 산포를 갖는 포아송 분포 모델링
Poisson 분포를 따를 것으로 예상되는 데이터 세트가 있지만 약 3 배 정도 과대 산포되어 있습니다. 현재 R의 다음 코드와 같은 것을 사용하여이과 분산을 모델링하고 있습니다. ## assuming a median value of 1500 med = 1500 rawdist = rpois(1000000,med) oDdist = rawDist + ((rawDist-med)*3) 시각적으로 이것은 경험적 데이터에 매우 잘 맞는 …

3
GAM vs GLM을 사용하는 경우
나는 이것이 잠재적으로 광범위한 질문 일 수 있음을 알고 있지만 GLM (Generalized linear model)보다 GAM (Generalized Additive Model)의 사용을 나타내는 일반화 가능한 가정이 있는지 궁금합니다. 누군가 최근에 GAM은 데이터 구조가 "가산 적"이라고 가정 할 때만 사용해야한다고했습니다. 즉, x를 더하면 y를 예측할 수 있습니다. 다른 사람은 GAM이 GLM과 다른 유형의 회귀 …

1
단일 ReLU가 ReLU를 배울 수없는 이유는 무엇입니까?
내 신경망에 대한 후속 조치로 유클리드 거리를 알 수조차 없으므로 나는 더 단순화하고 단일 ReLU (임의의 무게로)를 단일 ReLU로 훈련하려고했습니다. 이것은 가장 간단한 네트워크이지만 수렴하지 못하는 시간의 절반입니다. 초기 추측이 목표와 같은 방향에 있다면, 빠르게 학습하고 올바른 가중치 1로 수렴합니다. 초기 추측이 "뒤로"이면, 가중치 0에 갇히고 더 낮은 손실 영역으로 …

2
로지스틱 회귀 분석에 대한 신뢰 구간 계산
이항 로지스틱 회귀 분석을 사용 하여 사용자가 무언가를 클릭 할 가능성에 노출 has_x되거나 has_y영향을 미치는지 식별합니다 . 내 모델은 다음과 같습니다. fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) 이것은 내 모델의 출력입니다. Call: glm(formula = has_clicked ~ has_x + has_y, family = binomial(), data …

3
KL (Kullback-Leibler) 발산의 최대 값은 얼마입니까?
파이썬 코드에서 KL 분기를 사용 하고이 자습서를 얻었습니다 . 이 튜토리얼에서 KL 분기를 구현하는 것은 매우 간단합니다. kl = (model * np.log(model/actual)).sum() 이해 된 바와 같이, 확률 분포 model및 actual<= 1이어야한다. 내 질문은 k의 최대 한계 / 최대 가능한 값은 무엇입니까?입니다. 내 코드의 최대 경계와 관련하여 kl 거리의 최대 값을 …

4
귀무 가설 수락
이것은 통계와 다른 과학의 교차점에 대한 토론 질문입니다. 나는 종종 같은 문제에 직면한다. 내 분야의 연구원들은 p- 값이 유의 수준보다 작을 때 아무런 효과가 없다고 말하는 경향이있다. 처음에 나는 종종 이것이 가설 검정이 작동하는 방식이 아니라고 대답했다. 이 질문이 얼마나 자주 발생 하는지를 감안할 때이 문제를보다 숙련 된 통계 전문가와 …

2
머신 러닝에서 Bayes Error는 무엇입니까?
http://www.deeplearningbook.org/contents/ml.html 페이지 116에 베이 오류가 설명되어 있습니다. 이상적인 모델은 데이터를 생성하는 실제 확률 분포를 단순히 알고있는 오라클입니다. 이러한 모델조차도 많은 문제에서 여전히 약간의 오류가 발생합니다. 왜냐하면 분포에 약간의 노이즈가있을 수 있기 때문입니다. 지도 학습의 경우, x에서 y 로의 매핑은 본질적으로 확률 론적이거나 y는 x에 포함 된 것 이외의 다른 변수를 …

3
머신 러닝에서 데이터 누락 문제를 해결하는 방법
기계 학습 알고리즘을 사용하여 예측하려는 거의 모든 데이터베이스는 일부 특성에 대해 누락 된 값을 찾습니다. 결 측값이있는 선을 제외하여 특성의 평균값으로 채워질 때 까지이 문제를 해결하는 몇 가지 방법이 있습니다. 기본적으로 종속 변수 (Y)가 누락 된 값을 가진 각 열이 될 수있는 회귀 (또는 다른 방법)를 실행하는 다소 강력한 접근 …

2
관련 Bernoulli 시험, 다변량 Bernoulli 분포?
직장에서 가지고있는 연구 질문을 단순화하고 있습니다. 내가 5 개의 동전을 가지고 있고 머리를 성공적으로 부르 자고 상상해보십시오. 이들은 성공 확률 p = 0.1 인 매우 편향된 동전입니다. 이제 동전이 독립적이라면 적어도 1 머리 이상 확률을 얻는 것은 매우 간단합니다. . 내 시나리오에서 Bernoulli 시험 (코인 토스)은 독립적이지 않습니다. 내가 액세스 …

1
차동 엔트로피를 해석하는 방법?
나는 최근 에 이산 확률 분포의 엔트로피에 관한 이 기사를 읽었다 . 사용 하는 단어의 확률 분포를 고려하여 인코딩이 최적 일 때 메시지를 인코딩하는 데 필요한 예상 숫자 비트 (적어도 엔트로피 정의에서 를 사용하는 경우)로 엔트로피를 생각하는 좋은 방법을 설명합니다 .log2log2\log_2 그러나 여기 와 같은 연속 사례로 확장 할 때 …

2
정밀 리콜 곡선에서 "기준선"이란 무엇입니까
정밀 리콜 곡선을 이해하려고하지만 정밀도와 리콜이 무엇인지 이해하지만 이해하지 못하는 것은 "기준"값입니다. 나는이 링크를 읽고 있었다 https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ "완벽한 분류기의 정밀 리콜 곡선"에 표시된대로 기준 부분을 이해하지 못합니까? 어떻게 계산합니까? 우리가 선택한 임의의 기준입니까? 예를 들어 retweet,status_countetc와 같은 속성을 가진 트위터 데이터가 있고 내 클래스 레이블은 FavoritedFavorited 이면 1이고 Favorited가 아닌 …

3
다른 모든 정책보다 나은 정책이 항상 하나 이상있는 이유는 무엇입니까?
강화 학습 : 소개. 둘째 판, 진행 ., 리처드 S. 서튼와 앤드류 G. 바토 (C) 2012, PP. 67-68. 강화 학습 과제를 해결한다는 것은 대략 장기적으로 많은 보상을 얻는 정책을 찾는 것을 의미합니다. 유한 MDP의 경우 다음과 같은 방법으로 최적의 정책을 정확하게 정의 할 수 있습니다. 가치 함수는 정책에 대한 부분적 …

3
Frisch-Waugh 정리의 유용성
나는 내가 연구하지 않은 계량 경제학에서 프리쉬 우어 정리를 가르치기로되어있다. 나는 그 배후의 수학을 이해했으며 아이디어가 "여러 선형 모델에서 특정 계수에 대해 얻는 계수가 다른 회귀 변수의 영향을"제거 "하는 경우 단순 회귀 모형의 계수와 동일하기를 바랍니다. 이론적 아이디어는 멋지다. (내가 완전히 오해하면 정정을 환영합니다) 그러나 일부 고전적 / 실제적인 사용법이 …

5
훈련 데이터 세트에 대해서만 탐색 적 데이터 분석을 수행하는 것이 더 낫습니까?
데이터 세트에서 탐색 적 데이터 분석 (EDA)을 수행하고 있습니다. 그런 다음 종속 변수를 예측하기 위해 일부 기능을 선택합니다. 문제는 : 훈련 데이터 세트에 대해서만 EDA를 수행해야합니까? 아니면 교육 및 테스트 데이터 세트에 함께 참여한 후 EDA를 수행하고이 분석을 기반으로 기능을 선택해야합니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.