통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
로지스틱 Quantile 회귀 분석 – 결과를 가장 잘 전달하는 방법
이전 글 에서 EQ-5D 점수 를 다루는 방법에 대해 궁금했습니다 . 최근에 Bottai와 McKeown 이 제안한 로지스틱 Quantile 회귀 분석을 통해 우연한 결과를 다루는 우아한 방법을 소개했습니다. 공식은 간단합니다. logit(y)=log(y−yminymax−y)logit(y)=log(y−yminymax−y)logit(y)=log(\frac{y-y_{min}}{y_{max}-y}) log (0) 및 0으로 나누지 않도록 범위를 작은 값인 확장하십시오 . 이것은 점수의 경계를 존중하는 환경을 제공합니다.ϵϵ\epsilon 문제는 모든 가 …

2
관련 볼륨 시계열
다음 그래프를 고려하십시오. 빨간색 선 (왼쪽 축)은 특정 주식의 거래량을 나타냅니다. 파란색 선 (오른쪽 축)은 해당 주식의 트위터 메시지 볼륨을 나타냅니다. 예를 들어, 5 월 9 일 (05-09)에는 약 1 억 1 천만 건의 거래와 4 만 건의 트윗이 작성되었습니다. 같은 날 또는 지연과 함께 시계열 사이에 상관 관계가 있는지 …

2
스퓨리어스 상관의 예상 값
우리는 그리 크기의 각 샘플 일반 상태에서 독립적으로 분배한다.n ( μ , σ 2 )NNNnnn(μ,σ2)(μ,σ2)(\mu,\sigma^2) 로부터 샘플 우리는 서로 가장 높은 (절대) 피어슨 상관 관계를 가지고있는이 개 샘플을 선택합니다.NNN 이 상관 관계의 예상 값은 얼마입니까? 감사합니다 [PS 이것은 숙제가 아닙니다]

1
데이터로부터 분포 추정
에 R의해 생성 된 데이터 샘플이 rnorm(50,0,1)있으므로 데이터가 분명히 정규 분포를 취합니다. 그러나 R데이터에 대한이 배포 정보를 "알지"않습니다. R샘플이 어떤 종류의 분포에서 나오는지 추정 할 수 있는 방법 이 있습니까? 그렇지 않다면이 shapiro.test기능 을 사용 하고 계속 진행할 것입니다.
12 r  distributions 

2
부트 스트랩 대 베이지안 기술을 언제 사용해야합니까?
신뢰성 테스트와 관련하여 다소 복잡한 의사 결정 분석 문제가 있으며 논리적 접근 (나에게)은 MCMC를 사용하여 베이지안 분석을 지원하는 것으로 보입니다. 그러나 부트 스트랩 접근 방식을 사용하는 것이 더 적절하다고 제안되었습니다. 누군가가 (특정 상황에서도) 다른 기술을 사용하는 것을 지원할 수있는 참조 (또는 세 가지)를 제안 할 수 있습니까? FWIW, 여러 개의 …


3
매개 변수화 공분산 행렬이있는 양의 k 차원 사분면에 대한 분포는 무엇입니까?
부정적인 시뮬레이션에 대한 그의 문제에 대한 zzk 의 질문 에 이어 , 공분산 행렬 를 설정할 수있는 양의 k 차원 사분면 에서 매개 변수화 된 분포 패밀리가 무엇인지 궁금합니다 . ΣRk+R+k\mathbb{R}_+^kΣΣ\Sigma zzk 에서 설명한 것처럼 의 분포에서 시작 하여 선형 변환 적용하면 작동하지 않습니다. X⟶ Σ 1 / 2 (X-μ)+μRk+R+k\mathbb{R}_+^kX⟶Σ1/2(X−μ)+μX⟶Σ1/2(X−μ)+μX …

2
계층 적 베이지안 모델 (?)
통계 용어에 대한 정육점을 사과하십시오 :) 광고 및 클릭률과 관련된 몇 가지 질문이 있습니다. 그러나 그들 중 어느 것도 나의 계층 적 상황에 대한 나의 이해에 크게 도움이되지 않았습니다. 이와 관련된 질문 이 있습니다. 동일한 계층 적 베이지안 모델의 동등한 표현입니까? 하지만 실제로 비슷한 문제가 있는지 확실하지 않습니다. 또 다른 …

2
로지스틱 회귀 계수 분석
다음은 로지스틱 회귀 계수 목록입니다 (첫 번째는 인터셉트입니다). -1059.61966694592 -1.23890500515482 -8.57185269220438 -7.50413155570413 0 1.03152408392552 1.19874787949191 -4.88083274930613 -5.77172565873336 -1.00610998453393 절편이 너무 낮아서 실제로 0과 같은 계수를 갖는 것이 이상하다는 것을 알았습니다. 나는 이것을 어떻게 해석 할 것인지 완전히 확신하지 못합니다. 0은 특정 변수가 모델에 전혀 영향을 미치지 않음을 나타 냅니까? 그러나 …

2
모집단 평균에서 훨씬 더 멀리있는 값에 대한 통계 테스트 : Z- 테스트입니까, T- 테스트입니까?
값 목록과 비교하여 값이 얼마나 중요합니까? 대부분의 경우 통계 테스트에는 표본 세트를 모집단과 비교하는 것이 포함됩니다. 필자의 경우 샘플은 하나의 값으로 만들어지며 인구와 비교됩니다. 나는 아마도 가장 기본적인 문제에 직면 한 통계적 가설 테스트에있어 중요한 문제입니다. 그것은 단지 하나의 시험이 아니라 수백 가지의 시험입니다. 매개 변수 공간이 있으며 모든 점에 …

1
R의 부분 최소 제곱 회귀 : 표준화 된 데이터의 PLS가 상관을 최대화하는 것과 다른 이유는 무엇입니까?
나는 부분 최소 제곱 (PLS)에서 아주 새로운 오전 나는 R 함수의 출력을 이해하려고 노력 plsr()에서 pls패키지를. 데이터를 시뮬레이션하고 PLS를 실행하겠습니다 : library(pls) n <- 50 x1 <- rnorm(n); xx1 <- scale(x1) x2 <- rnorm(n); xx2 <- scale(x2) y <- x1 + x2 + rnorm(n,0,0.1); yy <- scale(y) p <- plsr(yy …

1
가우스 혼합 모델 (GMM) 작업을위한 Python 패키지
파이썬에서 Gaussian Mixture Models (GMMs) 작업에 사용할 수있는 몇 가지 옵션이있는 것 같습니다. 언뜻보기에는 최소한 : PyMix- http: //www.pymix.org/pymix/index.php 혼합물 모델링 도구 - PyEM http://www.ar.media.kyoto-u.ac.jp/members/david/softwares/em/ Scipy 도구 상자의 일부이며 GMM에에 초점을 맞출 것으로 보인다 지금으로 알려진 : 업데이트 sklearn.mixture . PyPR- http: //pypr.sourceforge.net/ 패턴 인식 및 GMM을 포함한 관련 도구 …

2
교차 검증 및 순서 형 로지스틱 회귀
순서 형 로지스틱 회귀 분석에 대한 교차 유효성 검사를 이해하려고합니다. 게임의 목표는 분석에 사용 된 모델의 유효성을 검사하는 것입니다. 먼저 장난감 데이터 세트를 구성합니다. set.seed(1) N <- 10000 # predictors x1 <- runif(N) x2 <- runif(N) x3 <- runif(N) # coeffs in the model a <- c(-2,-1) x <- -x1+2*x2+x3 …

1
분석 형태를 가질만큼 단순 할 때 사후 분포를 알아내는 단계는?
이것은 또한 전산 과학에서 요청 되었습니다. 11 개의 데이터 샘플을 사용하여 자동 회귀에 대한 일부 계수의 베이지안 추정치를 계산하려고합니다 여기서 는 평균이 0이고 분산이 가우시안입니다 . 벡터에 대한 사전 분포 는 평균이 가우시안이고 평균이 인 대각선 공분산 행렬입니다. 대각선 항목은 .Yi=μ+α⋅Yi−1+ϵiYi=μ+α⋅Yi−1+ϵi Y_{i} = \mu + \alpha\cdot{}Y_{i-1} + \epsilon_{i} ϵiϵi\epsilon_{i}σ2eσe2\sigma_{e}^{2}(μ,α)t(μ,α)t(\mu, \alpha)^{t}(0,0)(0,0)(0,0)σ2pσp2\sigma_{p}^{2} …

1
Duda et al의 패턴 분류에서 무료 점심 정리 이해하기
Duda, Hart 및 Stork의 패턴 분류 섹션 9.2 고유 분류 자 ​​부족의 섹션 9.2에 사용 된 표기법에 대해 몇 가지 질문이 있습니다 . 먼저 책에서 관련 텍스트를 인용하겠습니다. 단순화를 위해 트레이닝 세트의 두 종류의 문제를 고려 DDD 패턴 구성을 xixix^i 및 관련 카테고리 라벨 yi=±1yi=±1y_i = ± 1 위해 i=1,...,ni=1,...,ni …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.