통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
일반적으로 예측을하는 것보다 추론을하는 것이 더 어렵습니까?
내 질문은 다음 사실에서 비롯됩니다. 나는 기계 학습에 관한 책뿐만 아니라 게시물, 블로그, 강의를 읽었습니다. 기계 학습 전문가들이 통계 학자 / 경제학자들이 관심을 갖는 많은 것들에 무관심한 것 같습니다. 특히 머신 러닝 전문가는 추론보다 예측 정확도를 강조합니다. 코스타 에서 Andrew Ng의 기계 학습 을 수행 할 때 그러한 예가 발생했습니다 …

5
교차 엔트로피 비용이 회귀 상황에서 의미가 있습니까?
교차 엔트로피 비용은 회귀와 관련하여 (분류가 아닌) 의미가 있습니까? 그렇다면 TensorFlow를 통해 장난감 예제를 제공 할 수 있습니까? 그렇지 않다면 왜 안됩니까? Michael Nielsen의 Neural Networks 및 Deep Learning 에서 교차 엔트로피에 대해 읽었 으며 회귀 및 분류에 자연스럽게 사용할 수있는 것처럼 보이지만 이후 TensorFlow에서 어떻게 효율적으로 적용하는지 이해할 수 …


4
성향 추론에 대한 성향 스코어 매칭이 작동하는 이유는 무엇입니까?
성향 점수 매칭은 관찰 연구에서 인과 추론을 만드는 데 사용됩니다 ( Rosenbaum / Rubin 논문 참조 ). 왜 작동하는지에 대한 간단한 직감은 무엇입니까? 다시 말해, 치료에 참여할 확률이 두 그룹에 대해 동일한 지 확인하는 경우 혼란스러운 효과가 사라지고 결과를 사용하여 치료에 대한 인과적인 결론을 내릴 수있는 이유는 무엇입니까?

1
LogisticRegressionCV에서 비 수렴을 수정하는 방법
scikit-learn을 사용하여 일련의 데이터에 대해 교차 검증을 사용하여 로지스틱 회귀 분석을 수행하고 있습니다 (약 7000 개의 정규 관측 값을 갖는 약 14 개의 매개 변수). 또한 1 또는 0 값을 가진 대상 분류 기가 있습니다. 내가 가진 문제는 사용 된 솔버에 관계없이 수렴 경고가 계속 발생한다는 것입니다 ... model1 = …

4
R에서 nls 모델에 대한 올바른 시작 값 얻기
간단한 전력 법칙 모델을 다음과 같은 데이터 세트에 맞추려고합니다. mydf: rev weeks 17906.4 1 5303.72 2 2700.58 3 1696.77 4 947.53 5 362.03 6 목표는 전력선을 통과시켜 rev향후 몇 주 동안 vlaues 를 예측하는 데 사용하는 것입니다. 많은 연구 결과에 nls따라 다음과 같이 구현되었습니다. newMod <- nls(rev ~ a*weeks^b, data=modeldf, …

2
능선 회귀가 LASSO보다 더 나은 해석 성을 제공 할 수없는 이유는 무엇입니까?
능선 회귀와 LASSO의 장단점에 대해 이미 알고 있습니다. LASSO의 경우, L1 페널티 항은 희소 계수 벡터를 생성하며, 이는 특징 선택 방법으로 볼 수 있습니다. 그러나 LASSO에는 몇 가지 제한 사항이 있습니다. 기능의 상관 관계가 높은 경우 LASSO는 그 중 하나만 선택합니다. 또한 > 인 문제의 경우 LASSO는 최대 매개 변수를 …


4
행 정규화의 목적은 무엇입니까
열 정규화의 이유는 동일한 척도로 측정되지 않더라도 피쳐에 동일한 가중치를 부여하기 때문에 이해하지만, 가장 가까운 이웃 문헌에서는 종종 열과 행이 정규화됩니다. 행 정규화 란 무엇입니까? 왜 행을 정규화합니까? 구체적으로, 행 정규화의 결과는 행 벡터 간의 유사성 / 거리에 어떻게 영향을 줍니까?

4
로지스틱 회귀 분석에서 연속 독립 변수에 대해 로짓에 대한 선형성의 가정을 어떻게 확인해야합니까?
로지스틱 회귀 분석에서 연속 예측 변수에 대한 로짓에 대한 선형성의 가정과 혼동됩니다. 일 변량 로지스틱 회귀 분석을 사용하여 잠재적 예측 변수를 스크리닝하는 동안 선형 관계를 확인해야합니까? 제 경우에는 다중 로지스틱 회귀 분석을 사용하여 참가자의 영양 상태 (이 분적 결과)와 관련된 요인을 식별하고 있습니다. 연령, Charlson 동 반성 점수, Barthel 지수 …


1
샴 신경망에서 역전 파는 어떻게 작동합니까?
나는 서명 인식을 위해 1994 년 Yann LeCun과 그의 동료들에 의해 소개 된 샴 신경망의 아키텍처를 연구하고 있습니다 ( “샴페인 시간 지연 신경망을 사용한 서명 검증”.pdf , NIPS 1994) 이 아키텍처의 일반적인 개념을 이해했지만이 경우 역 전파가 어떻게 작동하는지 이해할 수 없습니다. 신경망의 목표 값이 무엇인지 이해할 수 없으므로 백 …

2
바이어스 부트 스트랩 : CI를 관측 된 통계를 중심으로해도 괜찮습니까?
이것은 부트 스트랩 과 유사합니다 : 추정이 신뢰 구간을 벗어났습니다. 인구의 유전자형 수를 나타내는 데이터가 있습니다. Shannon의 지수를 사용하여 유전 다양성을 추정하고 부트 스트랩을 사용하여 신뢰 구간을 생성하고 싶습니다. 그러나 부트 스트랩을 통한 추정치가 극도로 치우친 경향이 있으며 관찰 된 통계 범위를 벗어난 신뢰 구간을 초래한다는 것을 알았습니다. 아래는 예입니다. …

2
수축이란 무엇입니까?
수축이란 단어는 특정 원에서 많이 발생합니다. 그러나 수축이란 명확한 정의가없는 것 같습니다. 시계열 (또는 일부 프로세스의 관측치 모음)이있는 경우 시리즈에서 경험적 수축 유형을 측정 할 수있는 다른 방법은 무엇입니까? 내가 말할 수있는 다른 유형의 이론적 수축은 무엇입니까? 수축이 예측에 어떻게 도움이 될 수 있습니까? 사람들이 좋은 통찰력이나 참고 자료를 제공 …

3
Bernoulli 시행에서 "성공"확률을 추정하는 데 필요한 표본 크기
게임이 완료되면 보상을 주거나 아무것도 제공하지 않는 이벤트를 제공한다고 가정하십시오. 보상이 제공되는지 여부를 결정하는 정확한 메커니즘은 알려져 있지 않지만 난수 생성기를 사용한다고 가정하고 결과가 하드 코딩 된 값보다 큰 경우 보상을받습니다. 기본적으로 프로그래머가 보상이 얼마나 자주 주어지는 지 (15-30 % 추정) 결정하는 데 사용하는 가치를 역 엔지니어링하려면 필요한 샘플 수를 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.