통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A





4
일관되고 무증상의 편견의 차이점에 대한 직관적 인 이해
나는 일관성 있고 무증상이라는 용어 사이의 차이점과 실제적인 차이에 대해 직관적 인 이해와 느낌을 얻으려고 노력하고 있습니다. 나는 그들의 수학적 / 통계적 정의를 알고 있지만 직관적 인 것을 찾고 있습니다. 나에게 그들의 개별 정의를 보면 거의 같은 것 같습니다. 나는 그 차이가 미묘해야한다는 것을 알고 있지만 나는 그것을 보지 못한다. …

4
다중 출력 회귀 분석을위한 신경망
34 개의 입력 열과 8 개의 출력 열이 포함 된 데이터 세트가 있습니다. 문제를 해결하는 한 가지 방법은 34 개의 입력을 가져 와서 각 출력 열에 대해 개별 회귀 모델을 작성하는 것입니다. 이 문제를 신경망을 사용하는 하나의 모델로만 해결할 수 있는지 궁금합니다. 다층 퍼셉트론을 사용했지만 선형 회귀와 같은 여러 모델이 …

2
코시 분포의 표본 평균 분포는 무엇입니까?
일반적으로 분포의 표본 평균이 임의보다 크면 (샘플 크기가 30보다 큼) 평균값을 중심으로 정규 분포를 얻습니다. 그러나 Cauchy 분포는 평균 가치가 없다고 들었습니다. Cauchy 분포의 표본 평균을 얻을 때 어떤 분포를 얻습니까? 기본적으로 코시 분포 μ엑스μx\mu_x 정의되어 있지 않습니다. μ엑스¯μx¯\mu_{\bar{x}} 그리고 분포는 무엇입니까 엑스¯x¯\bar{x}?
14 cauchy 

1
범주 형 데이터를 사용하여 음 이항 GLM에서 .L 및 .Q 출력 해석
방금 음 이항 GLM을 실행했으며 출력입니다. Call: glm.nb(formula = small ~ method + site + depth, data = size.dat, init.theta = 1.080668549, link = log) Deviance Residuals: Min 1Q Median 3Q Max -2.2452 -0.9973 -0.3028 0.3864 1.8727 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.6954 0.1152 14.720 < 2e-16 …


1
가능성을 최대화하는 로지스틱 회귀 분석이 선형 모델보다 AUC를 최대화해야합니까?
이항 결과 와이∈ { 0 , 1 }엔y∈{0,1}ny\in\{0,1\}^n 및 일부 예측 변수 행렬 X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p} 갖는 데이터 세트가 주어지면 표준 로지스틱 회귀 모델 은 이항 우도를 최대화하는 계수 βMLEβMLE\beta_{MLE} 를 추정 합니다. XXX 가 전체 순위 일 때 βMLEβMLE\beta_{MLE} 는 유일하다; 완벽한 분리가 없으면 유한합니다. 이 최대 우도 모델이 ROC …

3
실제로 통계 관행이 열악한 통계에 대한 논문이 많이 있습니까?
통계 방법을 남용하는 방법은 여러 가지가 있습니다. 저명한 학술지에 처음으로 명백한 조언 (예 : "이 방법을 사용해야합니다 ...")으로 출판 된 좋지 않은 통계 관행의 예를 알고 있습니까? 예를 들어 로지스틱 또는 Cox PH 회귀 모델 ( LINK )에 대해 종종 호출되는 예측 자 규칙 당 10 개의 이벤트가 있습니다 . …

1
“RMSE의 2.5 배”를 기준으로 특이 치 제거
에서 얼 카너먼과 Deaton (2010) , 저자는 다음과 같은 쓰기 :††^\dagger 이 회귀 분석에서는 분산의 37 %를 설명하고 RMSE (root mean square error)는 0.67852입니다. 특이 치와 믿기 어려운 소득 보고서를 제거하기 위해 로그 소득과 예측 차이의 절대 값이 RMSE의 2.5 배를 초과 한 관측치를 삭제했습니다. 이것이 일반적인 관행입니까? 그렇게하는 직관은 …


5
로지스틱 회귀에 대한 철학적 질문 : 왜 최적의 임계 값이 훈련되지 않습니까?
일반적으로 로지스틱 회귀 분석에서는 모형에 적합하고 훈련 세트에 대한 예측을 얻습니다. 그런 다음 훈련 예측 ( 여기서 와 같은 ) 을 교차 검증 하고 ROC 곡선과 같은 것을 기반으로 최적의 임계 값을 결정합니다. 실제 모델에 임계 값의 교차 검증을 통합하고 전체를 전체적으로 학습하지 않는 이유는 무엇입니까?

2
로지스틱 회귀 분석에서 결정 임계 값이 하이퍼 파라미터입니까?
(이진) 로지스틱 회귀 분석에서 예측 된 클래스는 모델에 의해 생성 된 클래스 멤버쉽 확률에 대한 임계 값을 사용하여 결정됩니다. 내가 이해하는 것처럼 일반적으로 0.5가 기본적으로 사용됩니다. 그러나 임계 값을 변경하면 예측 분류가 변경됩니다. 임계 값이 하이퍼 파라미터라는 의미입니까? 그렇다면 (예를 들어) scikit-learn의 GridSearchCV방법을 사용하여 임계 값 그리드를 쉽게 검색 할 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.