통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
UMVUE
하자 농도에서 무작위로 일( X 1 , X 2 , ... , X N ) (X1,X2,…,Xn)(X_1,X_2,\ldots,X_n)F θ ( X ) = θ X θ - 1 1 0 < X < 1,θ > 0fθ(x)=θxθ−110<x<1,θ>0f_{\theta}(x)=\theta x^{\theta-1}\mathbf1_{00 의 UMVUE를 찾으려고합니다 .θ1 + θθ1+θ\frac{\theta}{1+\theta} 의 관절 밀도 는( X 1 , … , …

2
메타 분석에서 고정 효과 대 랜덤 효과 모델의 정당성
필자는 "이종성이 낮기 때문에 고정 효과 모델이 선택되었습니다"라는 문구를 사용하여 고정 효과 모델의 사용을 정당화하려는 여러 출판물을 읽었습니다. 그러나 데이터 분석에 여전히 부적절한 접근 방식 일 수 있습니다. 이것이 실수 일 수있는 이유와 이유를 논의하는 이유나 출판물이 있습니까?

4
리샘플링 된 데이터 세트에 대한 가설 테스트가 널을 너무 자주 거부하는 이유는 무엇입니까?
tl; dr : null에서 생성 된 데이터 세트로 시작하여 대체 사례를 리샘플링하고 각 리 샘플링 된 데이터 세트에 대해 가설 테스트를 수행했습니다. 이 가설 검정은 시간의 5 %를 초과하여 널을 거부합니다. 아래의 매우 간단한 시뮬레이션에서는 데이터 세트를 생성 엑스~ N( 0 , 1 ) ⨿ Y~ N( 0 , 1 …

5
단어 빈도 데이터의 분산을 측정하는 방법은 무엇입니까?
단어 개수로 구성된 벡터에서 분산 량을 어떻게 정량화 할 수 있습니까? 자주 발생하지 않는 여러 단어가 포함되어 있기 때문에 문서 A에 대해 높은 통계를 찾고 있는데, 자주 발생하는 단어 하나 (또는 ​​몇 단어)가 포함되어 있기 때문에 문서 B에 대해서는 낮습니다. 보다 일반적으로 명목 데이터의 분산 또는 "확산"을 어떻게 측정합니까? 텍스트 …

6
베이지안 통계를 가르치기위한 간단한 실제 사례?
베이지안 통계를 가르치기위한 "실제 사례"를 찾고 싶습니다. 베이지안 통계를 통해 사전 지식을 공식적으로 분석에 통합 할 수 있습니다. 학생들에게 사전 지식을 분석에 통합 한 간단한 실제 사례를 학생들에게 제공하여 학생들이 왜 베이지안 통계를 사용하고 싶은지에 대한 동기를 더 잘 이해할 수 있도록하고 싶습니다. 연구원들이 사전 정보를 공식적으로 통합 한 인구 …

3
선형 회귀 분석의 선형성 가정은 단순히 의 정의 입니까?
선형 회귀를 수정하고 있습니다. Greene의 교과서는 다음과 같이 말합니다. 물론, 선형 회귀 모델에 대한 다른 가정이있을 것입니다 예 : . 이 가정은 선형성 가정 (실제로 정의 ) 과 결합 하여 모델에 구조를 적용합니다.ϵE(ϵ|X)=0E(ϵ|X)=0E(\epsilon|X)=0ϵϵ\epsilon 그러나 선형성 가정 자체만으로는 모델에 어떠한 구조도 적용하지 않습니다. 은 완전히 임의적 일 수 있기 때문 입니다. …

2
부적절한 혼합물에서 정확한 샘플링
연속 분포 에서 표본을 추출한다고 가정 합니다. 양식 에 의 표현이 있으면p(x)p(x)p(x)ppp p(x)=∑i=1∞aifi(x)p(x)=∑i=1∞aifi(x)p(x) = \sum_{i=1}^\infty a_i f_i(x) 여기서 ai⩾0,∑iai=1ai⩾0,∑iai=1a_i \geqslant 0, \sum_i a_i= 1 및 fifif_i 는 쉽게 샘플링 할 수있는 분포이며, ppp 하여 쉽게 샘플을 생성 할 수 있습니다 . 확률 a_i 로 레이블 i 샘플링iiiaiaia_i 샘플링 X∼fiX∼fiX \sim …

1
언제 교차 검증을 사용하지 않습니까?
사이트를 읽으면서 대부분의 답변은 기계 학습 알고리즘에서 교차 유효성 검사를 수행해야한다고 제안합니다. 그러나 "머신 러닝 이해하기"라는 책을 읽으면서 때때로 교차 검증을 사용하지 않는 것이 더 나은 운동이 있다는 것을 알았습니다. 정말 혼란 스러워요. 전체 데이터에 대한 훈련 알고리즘이 교차 검증보다 낫습니까? 실제 데이터 세트에서 발생합니까? 를 k 가정 클래스로 하자 …

2
사건 확률의 합이 조합 확률과 같으면 사건이 분리되어 있음을 의미합니까?
공리적으로 확률은 세 가지 기본 가정 (콜 모고 로프의 가정)을 만족 하는 경우 각 이벤트 A에 실수 P ( A ) 를 할당 하는 함수 입니다 .PPPP(A)P(A)P(A)AAA P(A)≥0 for everyAP(A)≥0 for everyAP(A) \geq 0 \ \text{for every} A P(Ω)=1P(Ω)=1P(\Omega) = 1 If A1,A2,⋯are disjoint, thenP(⋃∞i=1Ai)=∑i=1∞P(Ai)If A1,A2,⋯are disjoint, thenP(⋃i=1∞Ai)=∑i=1∞P(Ai)\text{If} \ A_1, …

1
와 LASSO 관계
LASSO 회귀에 대한 나의 이해는 최소화 문제를 해결하기 위해 회귀 계수가 선택된다는 것입니다. minβ∥y−Xβ∥22 s.t.∥β∥1≤tminβ‖y−Xβ‖22 s.t.‖β‖1≤t\min_\beta \|y - X \beta\|_2^2 \ \\s.t. \|\beta\|_1 \leq t 실제로 이것은 Lagrange multiplier를 사용하여 수행되므로 문제를 해결할 수 있습니다. 분β∥ y− Xβ∥22+ λ ∥ β∥1minβ‖y−Xβ‖22+λ‖β‖1\min_\beta \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 λλ\lambda 와 …

4
커널 밀도 추정값에서 임의의 값을 임의로 그리는 방법은 무엇입니까?
몇 가지 관측치가 있으며이 관측치를 기반으로 샘플링을 모방하고 싶습니다. 여기서는 비모수 적 모델, 특히 커널 평활화를 사용하여 제한된 관측치에서 CDF를 추정합니다. 그런 다음 얻은 CDF에서 무작위로 값을 그립니다. 다음은 내 코드입니다. (아이디어는 무작위로 누적됩니다. 균일 분포를 사용한 확률, 확률 값과 관련하여 CDF의 역수를 취함) x = [randn(100, 1); rand(100, 1)+4; …

2
추정기가 랜덤 변수로 간주되는 이유는 무엇입니까?
추정기 및 추정치에 대한 나의 이해는 다음과 같습니다. 추정기 : 추정치를 계산하는 규칙 추정치 : 추정기에 기초한 데이터 세트에서 계산 된 값 이 두 용어 사이에서 랜덤 변수를 지적하라는 요청을 받으면 데이터 세트의 샘플에 따라 값이 무작위로 변경되므로 추정값이 랜덤 변수라고 말합니다. 그러나 내가 얻은 대답은 Estimator가 랜덤 변수이고 추정값이 …

2
회귀 분석에서 B- 스플라인 VS 고차 다항식
구체적인 예나 과제가 없습니다. b- 스플라인 사용에 익숙하지 않아서 회귀 컨텍스트에서이 기능을 더 잘 이해하고 싶었습니다. 반응 변수 와 일부 예측 변수 의 관계를 평가한다고 가정합니다 . 예측 변수에는 몇 가지 숫자 변수와 범주 형 변수가 포함됩니다.yyyx1,x2,...,xpx1,x2,...,xpx_1, x_2,...,x_p 회귀 모델을 피팅 한 후 과 같은 숫자 변수 중 하나 가 …

7
민감도 또는 특이성은 유병률의 함수입니까?
표준 교육에 따르면 민감도와 특이도는 시험의 특성이며 유병률과 무관합니다. 그러나 이것은 단순한 가정이 아닌가? 내과의 해리슨의 원칙 19 에드 감도와 특이성은 유병률에 독립적 인 테스트 정확도의 매개 변수라고 오랫동안 주장되어 왔으며 많은 텍스트가 여전히이 진술을합니다. 그러나이 통계적으로 유용한 가정은 임상 적으로 단순합니다. ... 입원 환자의 경우 검사 민감도가 높을 것이고 …

1
Beyer et al.의 상대 대비 정리입니까? 논문 :“고차원 공간에서 거리 측정법의 놀라운 행동”에 오해의 소지가 있습니까?
이것은 차원의 저주를 언급 할 때 자주 인용되며 (상대 대비라고하는 오른쪽 공식) 임디→ ∞var ( | | X디| |케이이자형[ | | 엑스디| |케이]) =0,다음:Dmaxk디−Dmin케이디디min케이디→ 0limd→∞var(||엑스디||케이이자형[||엑스디||케이])=0,그때:디최대디케이−디분디케이디분디케이→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 정리 결과는 주어진 쿼리 지점까지의 최대 거리와 최소 거리의 차이가 고차원 공간에서 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.