통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
Rao-Blackwell 정리는 왜 합니까?
라오-블랙웰 정리 하자 의 추정 될 와 모든 . 한다고 가정 충분 , 그리고하자 그런 다음 모든 , 가 의 함수가 아닌 한 부등식은 엄격합니다. θE( θ 2)&lt;∞θTθθ*=E( θ |T)θE(θ*-θ)2≤E( θ -θ)(2)θ^θ^\hat{\theta}θθ\thetaE(θ^2)&lt;∞E(θ^2)&lt;∞\Bbb E (\hat{\theta}^2) < \inftyθθ\thetaTTTθθ\thetaθ∗=E(θ^|T)θ∗=E(θ^|T)\theta ^ * = \Bbb E (\hat{\theta}|T)θθ\thetaE(θ∗−θ)2≤E(θ^−θ)2E(θ∗−θ)2≤E(θ^−θ)2\Bbb E (\theta^* - \theta )^2 \leq \Bbb E …

5
Layman의 용어로 평균, 중간, 모드 설명
숫자 목록의 평균, 중앙값 및 모드의 개념을 어떻게 설명하고 기본 산술 기술 만 가진 사람에게 중요한가? 왜도, CLT, 중심 경향, 통계적 특성 등은 언급하지 마십시오. 나는 누군가에게 숫자 목록을 "요약"하는 빠르고 더러운 방법이라고 설명했다. 그러나 되돌아 보면 이것은 거의 밝혀지지 않습니다. 어떤 생각이나 실제 사례?

1
로지스틱 회귀를 훈련시키는 데 "부분 신용"(연속 결과)을주는 것이 좋은 생각입니까?
나는 어떤 선수들이 혹독한 지구력 경주를 끝내게 될지 예측하기 위해 로지스틱 회귀를 훈련하고 있습니다. 이 경주를 마친 러너는 거의 없기 때문에 심각한 클래스 불균형과 작은 성공 사례 (수십 개)가 있습니다. 나는 거의 그것을 만든 수십 명의 주자로부터 좋은 "신호"를 얻을 수 있다고 생각 합니다. (내 훈련 데이터는 완성뿐만 아니라 완료되지 …

3
로지스틱 회귀 분석의 순위 기능
로지스틱 회귀를 사용했습니다. 6 가지 기능이 있는데이 분류기의 다른 기능보다 결과에 더 많은 영향을 미치는 중요한 기능을 알고 싶습니다. Information Gain을 사용했지만 사용 된 분류 기준에 의존하지 않는 것 같습니다. 로지스틱 회귀와 같은 특정 분류 기준에 따라 중요도에 따라 기능의 순위를 매기는 방법이 있습니까? 도움을 주시면 감사하겠습니다.

3
Dirac의 델타 함수가 가우스 분포의 하위 클래스로 간주되어야합니까?
위키 데이터에서, 온톨로지에서 확률 분포 (다른 모든 것과 같은)를 링크하는 것이 가능하다. 예를 들어, t- 분포는 비 중심 t- 분포의 서브 클래스이다. https://angryloki.github.io/wikidata-graph-builder/?property=P279&amp;item=Q209675&amp;iterations=3&amp;limit=3 예를 들어, t- 분포의 자유도가 무한대로되거나 정규 분포 (가우스 분포)에 대해 분산이 0에 도달하는 경우와 같은 다양한 제한 사례가 있습니다. 후자의 경우 분배는 Dirac의 델타 함수로 진행됩니다. …

3
선형 회귀 분석을 수행 할 때 기울기에 대해 유익하지 않은 사전 정보는 무엇입니까?
베이지안 선형 회귀를 수행 할 때 기울기 와 절편 대해 사전을 할당해야합니다 . 이후 위치 파라미터는 그것이 균일 사전 할당하는 것이 합리적이다; 그러나 는 스케일 매개 변수와 유사하며 이전에 유니폼을 할당하는 것은 부자연 스럽습니다.b b aaaabbbbbbaaa 반면 에 선형 회귀의 기울기에 대해 일반적인 정보가없는 Jeffrey를 ( ) 이전에 할당하는 것은 …


1
두 개의 샘플 카이 제곱 테스트
이 질문은 Van der Vaart의 저서 Asymptotic Statistics, pg에서 발췌 한 것입니다. 253. # 3 : 및 이 매개 변수 및 갖는 독립 다항식 벡터 라고 가정합니다 . 귀무 가설에서 는XmXm\mathbf{X}_mYnYn\mathbf{Y}_n(m,a1,…,ak)(m,a1,…,ak)(m,a_1,\ldots,a_k)(n,b1,…,bk)(n,b1,…,bk)(n,b_1,\ldots,b_k)ai=biai=bia_i=b_i ∑i=1k(Xm,i−mc^i)2mc^i+∑i=1k(Yn,i−nc^i)2nc^i∑i=1k(Xm,i−mc^i)2mc^i+∑i=1k(Yn,i−nc^i)2nc^i\sum_{i=1}^k \dfrac{(X_{m,i} - m\hat{c}_i)^2}{m\hat{c}_i} + \sum_{i=1}^k \dfrac{(Y_{n,i} - n\hat{c}_i)^2}{n\hat{c}_i} 에는 분포가 있습니다. 여기서 입니다.χ2k−1χk−12\chi^2_{k-1}c^i=(Xm,i+Yn,i)/(m+n)c^i=(Xm,i+Yn,i)/(m+n)\hat{c}_i = (X_{m,i} + Y_{n,i})/(m+n) 시작하는 …

1
"피타고라스의 야구 정리"뒤에 실제 통계가 있습니까?
저는 Sabermetrics, 특히 Wayne Winston의 Mathletics에 관한 책을 읽고 있습니다. 첫 번째 장에서 그는 팀의 승률을 예측하는 데 사용할 수있는 수량을 소개합니다. Scores Score 그는, 승리의 속도를 예측하는 데 사용할 수있는 반 시즌을 통해, 그 힌트 보인다 더 이상 시즌 전반의 승률 그는 공식을 일반화합니다 여기서 은 점수와 점수를 비교 …

1
ReLU 활성화가 SVM과 동일한 단일 계층 NeuralNetwork?
n 개의 입력과 단일 출력 (이진 분류 작업)이있는 간단한 단일 레이어 신경망이 있다고 가정합니다. 출력 노드에서 활성화 함수를 시그 모이 드 함수로 설정하면 결과는 로지스틱 회귀 분류기입니다. 이 시나리오에서 출력 활성화를 ReLU (정류 된 선형 단위)로 변경하면 결과 구조가 SVM과 같거나 비슷합니까? 왜 그렇지 않습니까?



1
MIMIC 요소와 지표가있는 합성물 (SEM)의 차이점은 무엇입니까?
잠복 변수 (SEM)를 사용한 구조 방정식 모델링에서 일반적인 모델 공식은 잠복 변수가 일부 변수에 의해 발생하고 다른 변수에 의해 반영되는 "다중 표시기, 다중 원인"(MIMIC)입니다. 다음은 간단한 예입니다. 기본적으로 f1의 회귀 결과입니다 x1, x2그리고 x3, 그리고 y1, y2그리고 y3에 대한 측정 지표이다 f1. 복합 잠재 변수를 정의 할 수도 있는데, 여기서 …

3
두 개의 유사한 시계열이 언제 발산하기 시작하는지 확인하기위한 통계 테스트
제목에서와 같이, 나는 두 개의 유사한 시계열 사이의 상당한 차이를 식별하는 데 도움이되는 통계 테스트가 존재하는지 알고 싶습니다. 구체적으로, 아래 그림을 보면, 시간 t1에서, 즉 이들 간의 차이가 커지기 시작할 때 계열이 분기되기 시작한다는 것을 감지하고 싶습니다. 또한 시리즈 간 차이가 중요하지 않은 시점을 감지합니다. 이를 위해 유용한 통계 테스트가 …

1
분산, 왜도 및 첨도 이상의 고차 누적 및 모멘트 이름
물리 또는 수학 역학에서 시간 기반 위치 부터 시작하여 시간 , 속도, 가속도, 저크 (3 차), ounce 스 (4 차)에 대한 도함수를 통해 변화율을 얻습니다 .x ( t )엑스(티)x(t) 일부는 이미 7 차까지 파생 상품에 대한 스냅, 딱딱, 팝 을 제안했습니다 . 기계 물리학 및 탄성 이론에서 영감을 얻은 순간은 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.