통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
계수 경로 – 융기, 올가미 및 탄성 그물 회귀 비교
능선, 올가미 및 탄성 그물로 선택한 모델을 비교하고 싶습니다. 아래 그림은 릿지 (그림 A, 알파 = 0), 올가미 (그림 B; 알파 = 1) 및 탄성 그물 (그림 C; 알파 = 0.5)의 세 가지 방법을 모두 사용하여 계수 경로를 보여줍니다. 최적의 솔루션은 선택된 람다 값에 따라 달라지며, 이는 교차 검증을 기반으로 …

2
phi, Matthews 및 Pearson 상관 계수의 관계
phi와 Matthews 상관 계수는 동일한 개념입니까? 두 이진 변수에 대한 Pearson 상관 계수와 어떻게 관련이 있습니까? 이진 값이 0과 1이라고 가정합니다. 두 Bernoulli 랜덤 변수 와 간의 Pearson 상관 관계 는 다음 과 같습니다.y엑스xx와이yy ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]−−−−−−−−−−√=E[xy]−E[x]E[y]Var[x]Var[y]−−−−−−−−−−√=n11n−n1∙n∙1n0∙n1∙n∙0n∙1−−−−−−−−−−√ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]=E[xy]−E[x]E[y]Var[x]Var[y]=n11n−n1∙n∙1n0∙n1∙n∙0n∙1 \rho = \frac{\mathbb{E} [(x - \mathbb{E}[x])(y - \mathbb{E}[y])]} {\sqrt{\text{Var}[x] \, \text{Var}[y]}} = \frac{\mathbb{E} [xy] - …

1
모델이 동일한 데이터 세트를 기반으로하는 한 AIC 값을 비교할 수 있습니까?
Rob Hyndman의 예측 패키지를 사용하여 R에서 일부 예측을 수행하고 있습니다 . 패키지에 포함 된 용지는 여기 에서 찾을 수 있습니다 . 이 논문에서 저자들은 자동 예측 알고리즘을 설명한 후 동일한 데이터 세트에서 알고리즘을 구현합니다. 그러나 지수 평활과 ARIMA 모델을 모두 추정 한 후에는 이해할 수없는 진술을합니다 (17 페이지). 정보 기준은 …

3
일원 분산 분석 불균형 분산에 대한 대안
동일한 크기의 세 그룹에 대한 평균을 비교하고 싶습니다 (동일한 샘플 크기가 작음, 21). 각 그룹의 평균 은 일반적으로 분포되어 있지만 분산은 동일하지 않습니다 (Levene를 통해 테스트). 이 상황에서 변혁이 가장 좋은 길입니까? 다른 것을 먼저 고려해야합니까?

3
여러 순위 목록의 전체 순위
나는 운이없이이 포럼을 포함하여 온라인으로 볼 수있는 많은 문헌들을 살펴 보았고 누군가 내가 현재 직면하고있는 통계적 문제를 도울 수 있기를 바랐다. 5 순위의 데이터 목록이 있으며 각 항목은 위치 1 (최고)에서 위치 10 (최악)까지 10 개의 항목을 포함합니다. 문맥 상, 각 목록의 10 개 항목은 동일하지만 순위를 결정하는 데 사용되는 …

1
MCMC 및 Metropolis-Hastings 알고리즘 이해
지난 며칠 동안 나는 Markov Chain Monte Carlo (MCMC)의 작동 방식을 이해하려고 노력해 왔습니다. 특히 Metropolis-Hastings 알고리즘을 이해하고 구현하려고 노력했습니다. 지금까지 나는 알고리즘에 대한 전반적인 이해가 있다고 생각하지만 아직 명확하지 않은 몇 가지가 있습니다. MCMC를 사용하여 일부 모델을 데이터에 맞추고 싶습니다. 이 때문에 나는 관측 된 데이터 직선 를 맞추기위한 …


3
유클리드 거리 점수 및 유사성
나는 Toby Segaran의 Collective Intelligence 책을 사용하여 유클리드 거리 점수를 발견했습니다. 이 책에서 저자는 두 개의 추천 배열 사이의 유사성을 계산하는 방법 (예 : 줍니다.사람 × 영화 ↦ 점수 )person×movie↦score)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) 그는 의해 두 사람 및 의 유클리드 거리를 계산합니다.p 2 d ( p 1 , p …

2
경험적 분포 대안
하사품: 아래의 견적서 를 사용하거나 언급 한 출판 된 논문에 대한 참조를 제공하는 사람에게 전체 현상금이 수여 됩니다.F~F~\tilde{F} 자극: 이 섹션은 아마도 당신에게 중요하지 않으며 나는 당신이 현상금을 얻는 데 도움이되지 않을 것이라고 생각하지만 누군가가 동기 부여에 대해 물었으므로 여기에 내가하고있는 일이 있습니다. 통계 그래프 이론 문제를 연구 중입니다. 표준 …

1
차동 엔트로피
가우스 RV의 차동 엔트로피는 입니다. 이것은 표준 편차 인 에 의존합니다 .σ로그2( σ2 π이자형−−−√)log2⁡(σ2πe)\log_2(\sigma \sqrt{2\pi e})σσ\sigma 랜덤 변수를 정규화하면 단위 분산을 가지므로 차분 엔트로피가 떨어집니다. 나에게 이것은 정규화 상수의 Kolmogorov 복잡성이 엔트로피의 감소에 비해 매우 작아야하기 때문에 반 직관적입니다. 이 랜덤 변수에 의해 생성 된 임의의 데이터 세트를 복구하기 위해 …

2
지수 랜덤 변수의 조건부 기대
임의 변수 ( )의 경우 같아야 무 메모리 속성에 의해 이후의 분포 동일하다 있지만만큼 우측으로 시프트 .X∼Exp(λ)X∼Exp(λ)X\sim \text{Exp}(\lambda)E[X]=1λE[X]=1λ\mathbb{E}[X] = \frac{1}{\lambda}E[X|X>x]E[X|X>x]\mathbb{E}[X|X > x]x+E[X]x+E[X]x + \mathbb{E}[X]X|X>xX|X>xX|X > xXXXxxx 그러나 나는 메모리리스 속성을 사용하여 구체적인 증거를 제공하기 위해 고심하고 있습니다. 도움을 주시면 감사하겠습니다. 감사.

1
연약한 모델에서 예측 된 생존자 곡선을 생성하는 방법 (R coxph 사용)?
[생존 패키지 사용] 약한 용어로 Cox 비례 위험 모델의 예상 생존자 함수를 계산하려고합니다. 연약한 항이 모형에 있으면 예측 생존자 함수를 계산할 수없는 것 같습니다. ## Example require(survival) data(rats) ## Create fake weight set.seed(90989) rats$weight<-runif(nrow(rats),0.2,0.9) ## Cox model with gamma frailty on litter fit <- coxph(Surv(time, status) ~ rx+weight+frailty(litter,dist="gamma"), data = …

1
생존 분석과 포아송 회귀 분석의 차이점은 무엇입니까?
특정 사용자의 사이트 방문 횟수를 사용하여 고전적인 이탈 예측 문제를 해결하고 있으며 Poisson Regression이 해당 사용자의 향후 참여를 모델링하는 데 적합한 도구라고 생각했습니다. 그때 나는 생존 분석과 위험 모델링에 관한 책을 봤는데 어떤 기술이 가장 좋은지 모르겠습니다. 두 주제를 동시에 연구하고 싶지 않으므로 과거 데이터와 인구 통계를 사용하여 사용자 참여를 …

1
쌍을 이룬 데이터에 대한 두 개의 생존 곡선 비교
생존 분석에서 상태 변화를 감지하는 두 가지 방법을 비교하고 싶습니다. 한 그룹의 피험자들이 더 오랜 기간 (수년) 동안 추적되고 있으며 상태 변화가 발생했는지 여부를 조사하기 위해 두 가지 검사 방법이 사용되었습니다. 한 가지 방법은 일 년에 두 번 각 대상을 검사하는 데 사용되고 두 번째 방법은 일 년에 한 번 …

3
회귀에 대한 제한된 Boltzmann 기계?
RBM 에 대해 이전에 질문 한 내용을 추적하고 있습니다. 나는 그것들을 설명하는 많은 문헌을 보았지만 실제로 회귀에 대해 이야기하지는 않았다 (라벨 데이터로 분류조차하지 않음). 레이블이없는 데이터에만 사용된다는 느낌이 들었습니다. 회귀 처리를위한 리소스가 있습니까? 아니면 숨겨진 레이어 위에 다른 레이어를 추가하고 CD 알고리즘을 위아래로 실행하는 것만 큼 간단합니까? 미리 감사드립니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.