통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
간단한 null과 대안이 동일한 분포 계열에 속하지 않는 경우 Neyman-Pearson 보조 정리를 적용 할 수 있습니까?
간단한 null과 간단한 대안이 동일한 분포 계열에 속하지 않는 경우에도 Neyman-Pearson 보조 정리를 적용 할 수 있습니까? 그 증거로 볼 수없는 이유를 모르겠습니다. 예를 들어, 단순 널이 정규 분포이고 단순 대안이 지수 분포 인 경우입니다. 가 우도 비율 테스트 할 때 두 분포의 다른 가족에 속하는 복합 대안에 대해 복합 …


1
랜덤 화 테스트와 순열 테스트의 차이점
문헌에서 랜덤 화와 치환이라는 용어는 서로 바꾸어 사용될 수 있습니다. 많은 저자들이 "순열 (일명 무작위 화) 테스트"라고 말하고 그 반대의 경우도 마찬가지입니다. 기껏해야 그 차이는 미묘하다고 생각하며, 데이터와 잠재적 결론에 대한 가정에 있습니다. 내 이해가 올바른지 또는 누락 된 더 깊은 차이가 있는지 확인하면됩니다. 순열 테스트는 데이터가 기본 모집단 분포 …

2
순위 상관을 사용한 정식 상관 분석
정식 상관 분석 (CCA)은 두 데이터 세트의 선형 조합에 대한 일반적인 Pearson 곱-모멘트 상관 (즉, 선형 상관 계수)을 최대화하는 것을 목표로합니다. 이제이 상관 계수가 선형 연관 만 측정한다는 사실을 고려하십시오. 이것이 우리가 예를 들어 Spearman- ρρ\rho 또는 Kendall- ττ\tau (순위) 상관 계수를 사용하는 이유이기도합니다. 변수 사이의 연결. 따라서 CCA의 한 …

3
콕스 모델과 로지스틱 회귀
다음과 같은 문제가 있다고 가정 해 봅시다. 다음 3 개월 동안 상점에서 구매를 중단 할 가능성이 가장 높은 고객을 예측하십시오. 각 고객에 대해 우리는 고객이 상점에서 구매하기 시작한 달을 알고 있으며 추가로 월별 집계에 많은 행동 기능이 있습니다. '가장 오래된'고객은 50 개월 동안 구매했습니다. 클라이언트가 ( ) 까지 구매를 시작한 …

3
조정 된 R- 제곱이 모형을 더 잘 예측하는 경우 조정 된 R- 제곱이 R- 제곱보다 작은 이유는 무엇입니까?
내가 이해하는 한, 아르 자형2아르 자형2R^2 는 모델이 관측 값을 얼마나 잘 예측하는지 설명합니다. 조정 된 는 더 많은 관측치 (또는 자유도)를 고려한 것입니다. 따라서 조정 된 는 모형을 더 잘 예측합니까? 그렇다면 왜 보다 작 습니까? 종종 더 많을 것 같습니다.R 2아르 자형2아르 자형2R^2아르 자형2아르 자형2R^2아르 자형2아르 자형2R^2

1
어떤 통계적 방법이 구식이며 교과서에서 생략해야합니까? [닫은]
현재로서는이 질문이 Q & A 형식에 적합하지 않습니다. 답변, 사실, 참고 자료 또는 전문 지식을 통해 답변이 뒷받침 될 것으로 예상되지만이 질문은 토론, 논쟁, 여론 조사 또는 광범위한 토론을 요구할 것입니다. 이 질문을 개선하고 다시 열 수 있다고 생각 되면 도움말 센터 를 방문하여 안내를 받으십시오 . 휴일 육년 전 …

1
공분산 행렬을 변수의 불확실성으로 변환 할 수 있습니까?
공분산 행렬 를 통해 노이즈 측정을 출력하는 GPS 장치가 있습니다 .ΣΣ\Sigma Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (이 또한의 참여하지만하자 잠깐 그것을 무시한다.)ttt 다른 사람에게 각 방향 ( ) 의 정확도 가 숫자 라고 말하고 …


2
다변량 가우스의 공분산 사후 분포 추정
샘플이 거의없는 이변 량 가우스 분포를 "학습"해야하지만 이전 분포에 대한 가설이 좋으므로 베이지안 접근법을 사용하고 싶습니다. 이전을 정의했습니다 : P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 & 0 \\ 0 & 27 \end{bmatrix} 그리고 내 분포는 …

1
R을 사용하여 포아송 프로세스를 추정하는 방법? (또는 : NHPoisson 패키지를 사용하는 방법?)
이벤트 데이터베이스 (예 : 날짜 변수) 및 관련 공변량이 있습니다. 이벤트는 고정되지 않은 포아송 프로세스에 의해 생성되며, 일부 공변량의 매개 변수는 알려지지 않은 (아마도 선형적인) 함수입니다. NHPoisson 패키지는이 목적으로 만 존재한다고 생각합니다. 그러나 15 시간 동안 연구에 실패한 후에도 여전히 그 사용법을 알 수있는 곳은 없습니다. 도대체, 나는 참고 문헌 …

2
정규 분포의 모수 추정 : 평균이 아닌 중앙값?
정규 분포의 모수를 추정하는 일반적인 방법은 평균 및 표본 표준 편차 / 분산을 사용하는 것입니다. 그러나 일부 특이 치가있는 경우 중앙값과 중앙값의 중앙값 편차가 훨씬 강력해야합니다. 내가 시도한 일부 데이터 세트에서 의해 추정 된 정규 분포 는 많은 양을 생성하는 것으로 보입니다 평균 및 RMS 편차를 사용 하는 기존의 보다 …

4
로짓 함수는 항상 이진 데이터의 회귀 모델링에 가장 적합합니까?
나는이 문제에 대해 생각하고있다. 이진 데이터 모델링을위한 일반적인 로지스틱 함수는 다음과 같습니다. 그러나 S 형 곡선 인 로짓 함수는 항상 데이터 모델링에 가장 적합합니까? 데이터가 정상적인 S 자형 곡선을 따르지 않고 도메인(0,1)을가진 다른 유형의 곡선을 따르는 것으로 생각할만한 이유가있을 수 있습니다.로그( p1 - p) = β0+ β1엑스1+ β2엑스2+ …로그⁡(피1−피)=β0+β1엑스1+β2엑스2+… \log\left(\frac{p}{1-p}\right)=\beta_0+\beta_1X_1+\beta_2X_2+\ldots …

1
왜 분산을 안정화합니까?
나는 Kaggle Essay Eval 방법 을 읽는 동안 분산 안정화 변환을 발견했습니다 . 분산 안정화 변환을 사용하여 평균을 취하기 전에 카파 값을 변환 한 다음 다시 변환합니다. 분산 안정화 변환에 대한 위키를 읽은 후에도 이해할 수 없습니다. 왜 실제로 분산을 안정화합니까? 이것으로 우리는 어떤 유익을 얻습니까?

1
gbm 패키지의 출력 용어 의미?
분류를 위해 gbm 패키지를 사용하고 있습니다. 예상대로 결과가 좋습니다. 그러나 분류기의 출력을 이해하려고합니다. 출력에는 5 개의 항이 있습니다. `Iter TrainDeviance ValidDeviance StepSize Improve` 누구나 각 용어의 의미, 특히 개선 의 의미를 설명 할 수 있습니까 ?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.