통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
“선형”대“비선형”회귀를 구별하는 것이 왜 중요한가?
선형 모델과 비선형 모델의 구별의 중요성은 무엇입니까? 질문 비선형 대 일반화 선형 모델 : 어떻게 물류, 포아송 등 회귀를 참조합니까? 그리고 그 대답은 일반화 된 선형 모델의 선형성 / 비선형성에 매우 도움이되었습니다. 비선형 모델과 선형을 구별하는 것이 매우 중요하지만 왜 나에게 명확하지 않습니까? 예를 들어 다음 회귀 모형을 고려하십시오. E[Y∣X]E[Y∣X]E[Y∣X]E[Y∣X]=β0+β1X=β0+β1X+β2X2=β0+β21X={1+exp(−[β0+β1X]}−1(1)(2)(3)(4)(1)E[Y∣X]=β0+β1X(2)E[Y∣X]=β0+β1X+β2X2(3)E[Y∣X]=β0+β12X(4)E[Y∣X]={1+exp⁡(−[β0+β1X]}−1\begin{align} …

2
Slutsky의 정리는 두 시퀀스가 ​​모두 비 변형 랜덤 변수로 수렴 될 때 여전히 유효합니까?
나는 Slutsky의 정리 에 대한 몇 가지 세부 사항에 대해 혼란스러워합니다 . 하자 , 스칼라 / 벡터 / 행렬 랜덤 요소 두 시퀀스 수.{Xn}{Xn}\{X_n\}{Yn}{Yn}\{Y_n\} 만약 임의의 요소에 분배 수렴 및 정수의 행 확률 수렴 다음 이 제공 여기서 가역 인 {\ xrightarrow {d}} 는 분포의 수렴을 나타냅니다.XnXnX_nXXXYnYnY_ncccXn+Yn XnYn Xn/Yn →d …

1
특별 확률 분포
경우 비 - 제로 값을 갖는 확률 분포에 의 유형 (들)에 대한 일정에 존재 않는 되도록 모두 ?p(x)p(x)p(x)[0,+∞)[0,+∞)[0,+\infty)p(x)p(x)p(x)c>0c>0c\gt 0∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^20<ϵ<10<ϵ<10\lt\epsilon\lt 1 위의 불평등은 실제로 분포 와 그것의 압축 버전 사이의 Kullback-Leibler Divergence 입니다. 이 부등식이 지수, 감마 및와 이블 분포에 적용된다는 것을 알았으며 더 큰 부류의 확률 …

1
귀무 가설 하에서 결정 계수
이 텍스트의 첫 페이지 하단에 아르 자형2a d j u s t e dRadjusted2R^2_\mathrm{adjusted} 조정에 관한 진술이 궁금합니다. 아르 자형2a d j u s t e d= 1 - ( 1 - R2) ( n - 1n - m - 1) .Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). 텍스트 상태는 다음과 같습니다. 조정의 논리는 다음과 …

2
가우스 프로세스의 파생
나는 가우시안 프로세스 (GP)의 미분이 또 다른 GP라고 생각하므로 GP의 미분의 예측 방정식에 대해 닫힌 형태 방정식이 있는지 알고 싶습니다. 특히, 나는 제곱 지수 (가우시안이라고도 함) 공분산 커널을 사용하고 있으며 가우시안 프로세스의 미분에 대한 예측을 알고 싶습니다.


2
확률 모델을 교정하는 동안 최적의 빈 너비를 선택하는 방법은 무엇입니까?
배경 : 결과 발생 가능성을 예측하는 모델을 교정하는 방법에 대한 몇 가지 훌륭한 질문 / 답변이 있습니다. 예를 들어 브리 어 점수 및 결의, 불확실성 및 신뢰성 으로의 분해 . 교정 플롯 및 등장 회귀 . 이러한 방법은 종종 예측 된 확률에 비닝 방법을 사용해야하므로 결과의 동작 (0, 1)이 평균 …

1
포아송 대 준-포아송 모형에서 추정 된 동일한 계수
보험 환경에서 클레임 수 데이터를 모델링 할 때 Poisson으로 시작했지만 과대 산포가 나타났습니다. Quasi-Poisson은 기본 Poisson보다 더 큰 평균-분산 관계를 더 잘 모델링했지만 계수가 Poisson과 Quasi-Poisson 모델에서 동일하다는 것을 알았습니다. 이것이 오류가 아닌 경우 왜 이런 일이 발생합니까? Poisson보다 Quasi-Poisson을 사용하면 어떤 이점이 있습니까? 참고 사항 : 근본적인 손실은 초과 …

4
문제가 선형 회귀에 적합하다는 결론
Montgomery, Peck 및 Vining의 선형 회귀 분석 소개를 사용하여 선형 회귀를 배우고 있습니다. 데이터 분석 프로젝트를 선택하고 싶습니다. 설명 회귀 변수와 반응 변수 사이에 선형 기능 관계가 있다고 의심되는 경우에만 선형 회귀가 적합하다는 순진한 생각을했습니다. 그러나 많은 실제 응용 프로그램이이 기준을 충족시키는 것 같지는 않습니다. 그러나 선형 회귀는 매우 널리 …

1
t- 검정에 대한“대략 정상”의 평가
Welch의 t- 검정을 사용하여 평균의 동등성을 테스트하고 있습니다. 근본적인 분포는 정상과는 거리가 멀다 ( 여기서는 관련 토론의 예보다 비뚤어 짐 ). 더 많은 데이터를 얻을 수 있지만 어느 정도까지 결정하는 원칙적인 방법을 원합니다. 표본 분포가 수용 가능하다는 평가를 내리는 데 좋은 휴리스틱이 있습니까? 정규 성과의 편차는 가장 중요합니까? 표본 통계에 …

1
파이썬에서 순서 형 로지스틱 회귀
세 가지 수준과 설명 요소가있는 반응 변수에 대해 파이썬에서 순서 형 로지스틱 회귀를 실행하고 싶습니다. 이 statsmodels패키지는 이진 로짓 및 다항 로짓 (MNLogit) 모델을 지원하지만 순서가 지정된로 짓은 지원하지 않습니다. 기본 수학이 다르지 않기 때문에 이것을 사용하여 쉽게 구현할 수 있는지 궁금합니다. (또는 작동하는 다른 Python 패키지도 높이 평가됩니다.)


1
로지스틱 회귀 분석에서 적합도 검정; 어떤 '적합'을 테스트하고 싶습니까?
나는 질문과 그 답을 언급하고 있습니다 : 로지스틱 회귀에서 개발 된 모델의 예측 능력을 비교하는 방법은 무엇입니까? @Clark Chong의 답변 및 @Frank Harrell의 답변 / 댓글. 그리고 Hosmer-Lemeshow 테스트에서 의 자유도χ2χ2\chi^2 및 질문에 대한 질문 . 나는 DW Hosmer, T. Hosmer, S. Le Cessie, S. Lemeshow 논문, "물류 회귀 모형에 …

2
시간에 따른 잘린 역 전파를 사용할 때 초기 패턴 캡처 (RNN / LSTM)
RNN / LSTM을 사용하여 감정 분석을 수행한다고하는데, 이는 다 대일 접근 방식입니다 ( 이 블로그 참조 ). 네트워크는 절단 된 역 전파 전파 시간 (BPTT)을 통해 훈련되며, 여기서 네트워크는 평소와 같이 30 개의 마지막 단계 만 수행됩니다. 필자의 경우 분류하려는 각 텍스트 섹션이 풀리는 30 단계 (~ 100 단어)보다 훨씬 …


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.