통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
변수 선택에 대한 충돌 접근법 : AIC, p- 값 또는 둘 다?
내가 이해 한 바에 따르면, p- 값을 기반으로 한 변수 선택 (적어도 회귀 컨텍스트에서)에는 결함이 있습니다. AIC (또는 유사한)를 기반으로 한 변수 선택도 비슷한 이유로 약간의 결함으로 간주됩니다. 비록 이것이 다소 불분명 한 것처럼 보이지만 (예를 들어 내 질문 과이 주제에 대한 일부 링크를 참조하십시오 : "단계적 모델 선택"은 정확히 …


2
r, r 제곱 및 잔차 표준 편차는 선형 관계에 대해 무엇을 알려줍니까?
약간의 배경 회귀 분석의 해석에 대해 연구하고 있지만 r, r 제곱 및 잔차 표준 편차의 의미에 대해 실제로 혼란스러워합니다. 나는 정의를 알고있다 : 특성 r은 산점도에서 두 변수 사이의 선형 관계의 강도와 방향을 측정합니다 R 제곱은 데이터가 적합 회귀선에 얼마나 가까운 지에 대한 통계적 측정 값입니다. 잔차 표준 편차는 선형 …

2
간단히 말해서 KKT
객관적인 KKT에 대한 이해가 올바른지 확인하십시오. KKT에 대한 자세한 설명과 확인을 받으십시오. 배경 KKT 조건, 특히 보완적인 조건을 이해하려고하면 SVM 기사에서 항상 파란색으로 나타납니다. 추상 수식 목록은 필요하지 않지만 구체적이고 직관적이며 그래픽적인 설명이 필요합니다. 질문 비용 함수 f (X)를 최소화하는 P가 제약 조건 (g (P)> = 0) 내에 있으면 솔루션입니다. …

1
순환 데이터의 시계열 모델링
일부 바람 / 파도 데이터에 대한 ARIMA 모델을 구축 중입니다. 각 변수에 대해 별도의 모델을 작성 중입니다. 모델링해야 할 변수 중 두 가지는 파도와 바람 방향입니다. 값은도 (0-360 °)입니다. 값 간격이 원형 인이 유형의 데이터를 모델링 할 수 있습니까? 그렇지 않다면, 이런 종류의 데이터에 가장 적합한 모델은 무엇입니까?

4
두 변수의 합이 개별 변수보다 더 많은 분산을 어떻게 설명 할 수 있습니까?
두 예측 변수가 음의 상관 관계가있는 경우 세 번째 변수와 합계의 상관 관계에 대한 혼란스러운 결과가 나타납니다. 이러한 난처한 결과의 원인은 무엇입니까? 예 1 : 두 변수의 합과 세 번째 변수의 상관 아래 표시된 Guildford의 1965 년 텍스트의 427 페이지에있는 공식 16.23을 고려하십시오. 당황한 결과 : 두 변수가 .2를 세 …

3
분류를 위해 T-SNE를 사용하여 하이퍼 파라미터 선택
(경쟁)으로 작업하는 특정 문제로 21 가지 기능 ([0,1]에서 숫자) 및 이진 출력이라는 다음 설정이 있습니다. 약 100K 행이 있습니다. 설정이 시끄 럽습니다. 나와 다른 참가자는 잠시 동안 기능 생성을 적용하고이 설정에서는 t- 분산 확률 론적 이웃 임베딩이 다소 강력한 것으로 나타났습니다. 나는 "t-SNE를 효과적으로 사용하는 방법"이라는 글을 우연히 발견 했지만 …

1
데이터 행렬이 대각선 일 때 올가미 문제에 대한 닫힌 양식 솔루션
\newcommand{\diag}{\operatorname{diag}} 문제가 있습니다 : minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), : ∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag⁡(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). 이 경우 폐쇄 형 솔루션이 있습니까? 나는 그것을 가지고있다 : (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag⁡(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), 그래서 대답은 : wj=yjmax{0,1−λn|yj|},wj=yjmax{0,1−λn|yj|},w\,^j=y\,^j\max\left\{0,1-\lambda \frac{n}{|y^j|}\right\}, 에 대한 yj=∑i=1nyixijσ2iyj=∑i=1nyixijσi2y\,^j=\displaystyle\sum_{i=1}^n\frac{y_ix_i\,^j}{\sigma_i^2} 하지만 확실하지 않습니다.

2
통계적 관점에서 : 푸리에 기준으로 푸리에 변환 대 회귀
이산 푸리에 변환이 푸리에 기준을 사용하여 회귀와 동일한 곡선 표현을 제공하는지 이해하려고합니다. 예를 들어 library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT는 복소수를 제공하지만 회귀는 실수를 제공합니다. 그들은 같은 …

2
신경망이 왜 쉬운가?
신경망을 "어리석게"하기 위해 이미지를 수동으로 구성하는 방법에 대한 논문을 읽었습니다 (아래 참조). 네트워크가 조건부 확률 만 모델링하기 때문 입니까? 네트워크가 결합 확률 모델링 할 수있는 경우에도 그러한 경우가 발생합니까?p ( y , x )p(y|x)p(y|x)p(y|x)p(y,x)p(y,x)p(y,x) 내 생각에 인위적으로 생성 된 이미지가 훈련 데이터와 다르므로 확률이 낮습니다 . 따라서 이러한 이미지에 대해 …

3
이 AP 중앙 페이지에서 랜덤 변수 대 대수 변수 에서 Peter Flanagan-Hyde는 대수 변수와 랜덤 변수를 구분합니다. 부분적으로 그는 말한다 X + X ≠ 2 Xx+x=2xx+x=2xx + x = 2x 이지만 X+X≠2XX+X≠2XX + X \neq 2X 실제로 기사의 자막입니다. 대수 변수와 랜덤 변수의 기본 차이점은 무엇입니까?

3
MCMC 수행 : jags / stan을 사용하거나 직접 구현
저는 베이지안 통계 연구를 처음 사용합니다. 베이지안 연구원들이 JAGS / Stan과 같은 도구를 사용하는 대신 MCMC를 스스로 구현하는 것이 더 좋다고 연구원들로부터 들었습니다. 학습 목적을 제외하고 MCMC 알고리즘을 R과 같이 "빠르지 않은"언어로 구현하면 어떤 이점이 있습니까?
13 bayesian  mcmc 


5
수학 통계의 어떤 영역이 많이 사용됩니까?
나는 통계에서 명예를 끝내려고하고 있으며, 수학 통계가 매우 흥미 롭기 때문에 박사 학위를 받고 싶습니다. 내가 박사 학위를 가장하고 싶은 분야는 확률 적 과정과 시계열입니다. 그러나 박사 학위를받은 후 민간 부문에서 경력을 쌓고 싶습니다. 민간 부문에서 어떤 수학 통계 영역이 가장 많이 사용되는지, 어떤 유형의 직업에서 사용되는지 궁금합니다. 분명히 나는 …

3
고차 다항식에 대한 계수가 큰 이유는 무엇입니까?
기계 학습에 관한 Bishop의 저서에서는 다항식 함수를 일련의 데이터 포인트에 곡선 맞춤하는 문제에 대해 설명합니다. M을 다항식 차수로하자. 그 상태로 우리는 M이 증가함에 따라 계수의 크기가 일반적으로 커짐을 알 수 있습니다. 특히 M = 9 다항식의 경우 계수는 양의 양수 값과 음수 값을 개발하여 데이터에 맞게 미세 조정되어 해당 다항식 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.