통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


4
오차가 정규 분포를 따르지 않는 경우 최소 제곱 법과 최대 가능성 회귀 분석법이 다른 이유는 무엇입니까?
제목은 모든 것을 말합니다. 최소 오차와 최대 확률은 모형의 오차가 정규 분포를 따르는 경우 회귀 계수에 대해 동일한 결과를 제공한다는 것을 이해합니다. 그러나 오류가 정상적으로 분포되지 않으면 어떻게됩니까? 두 방법이 더 이상 동일하지 않은 이유는 무엇입니까?

1
표준 정규 랜덤 변수의 PDF 및 CDF 기능의 볼록 함
가 볼록한 라는 증거를 제공하십시오. . 여기서 및 는 각각 표준 일반 PDF 및 CDF입니다.Q(x)=x2+xϕ(x)Φ(x)Q(x)=x2+xϕ(x)Φ(x)Q\left(x\right)=x^{2}+x\frac{\phi\left(x\right)}{\Phi\left(x\right)}∀x>0∀x>0\forall x>0 ϕϕ\phiΦΦ\mathbf{\Phi} 시도한 단계 1) 캘러스 방법 미적분법을 시도하고 두 번째 미분에 대한 공식을 가지고 있지만 그것이 긍정적 임을 나타낼 수는 없습니다 . 더 자세한 정보가 필요하면 알려주십시오.∀x>0∀x>0\forall x > 0 마지막으로 Let Q(x)=x2+xϕ(x)Φ(x)Let Q(x)=x2+xϕ(x)Φ(x)\begin{eqnarray*} …

5
시계열 데이터 예측에 대해 탐지 된 특이 치를 수정하는 방법은 무엇입니까?
시계열 데이터에서 이상 값을 찾거나 감지하면 이상 값을 수정하는 방법을 찾으려고합니다. R의 nnetar와 같은 일부 방법은 이상 치가 큰 시계열에 대해 약간의 오류를 발생시킵니다. 이미 결 측값을 수정했지만 이상 치가 여전히 내 예측을 손상시키고 있습니다 ...

1
R 예측 패키지의 TBATS를 사용하여 시계열 분해 해석
다음 시계열 데이터를 계절, 추세 및 잔존 성분으로 분해하고 싶습니다. 데이터는 상업용 건물의 시간별 냉각 에너지 프로파일입니다. TotalCoolingForDecompose.ts <- ts(TotalCoolingForDecompose, start=c(2012,3,18), freq=8765.81) plot(TotalCoolingForDecompose.ts) 따라서 다음과 같은 조언을 바탕으로 일일 및 주간 계절 효과가 분명합니다. 여러 계절 성분으로 시계열을 분해하는 방법은 무엇입니까? 패키지 의 tbats기능을 사용했습니다 forecast. TotalCooling.tbats <- tbats(TotalCoolingForDecompose.ts, seasonal.periods=c(24,168), …

1
지수와 감마 사이의 분포 이름?
밀도 파라미터이며, 지수와 생활 ( ) 및 ( ) 분포. 이것이 더 일반적인 배포판의 예가 될지 궁금하십니까? 나는 그것을 인식하지 못한다.에프( s의 ) α (S)s + α이자형− s,s > 0에프(에스)∝에스에스+α이자형−에스,에스>0f(s)\propto \frac{s}{s+\alpha}e^{-s},\quad s > 0α ≥ 0α≥0\alpha \ge 0α = 0α=0\alpha=0Γ ( 2 , 1 )Γ(2,1)\Gamma(2,1)α → ∞α→∞\alpha \to \infty

1
반복 측정 값 anova : lm vs lmer
반복 측정 (2x2x2) lm과 lmer반복 측정 사이에 여러 상호 작용 테스트를 재현하려고합니다 . 두 방법을 비교하고 싶은 이유는 SPSS의 반복 측정에 대한 GLM이 lm여기에 제시된 방법 과 정확히 동일한 결과를 산출하기 때문에 결국 SPSS와 R-lmer를 비교하고 싶기 때문입니다. 지금까지 이러한 상호 작용 중 일부만 (근접 적으로) 재현했습니다. 내 요점을 더 …

2
독일 전차 문제 해결
용액받는 것을 공식적인 증명 있는가 독일어 탱크 문제점 의 함수 만 파라미터 k는 (관측 된 샘플의 수)와 m (관찰 시료 중에서 최대 값)? 다시 말해, 솔루션이 최대 값 외에 다른 샘플 값과 독립적이라는 것을 증명할 수 있습니까?

1
(X,Y)(X,Y)(X,Y) 에 pdf가 있다고 가정 fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0f_{\theta}(x,y)=e^{-(x/\theta+\theta y)}\mathbf1_{x>0,y>0}\quad,\,\theta>0 따라서이 모집단에서 추출한 샘플의 밀도 (X,Y)=(Xi,Yi)1≤i≤n(X,Y)=(Xi,Yi)1≤i≤n(\mathbf X,\mathbf Y)=(X_i,Y_i)_{1\le i\le n} 은 gθ(x,y)=∏i=1nfθ(xi,yi)=exp[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0gθ(x,y)=∏i=1nfθ(xi,yi)=exp⁡[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp⁡[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0\begin{align} g_{\theta}(\mathbf x,\mathbf y)&=\prod_{i=1}^n f_{\theta}(x_i,y_i) \\&=\exp\left[{-\sum_{i=1}^n\left(\frac{x_i}{\theta}+\theta y_i\right)}\right]\mathbf1_{x_1,\ldots,x_n,y_1,\ldots,y_n>0} \\&=\exp\left[-\frac{n\bar x}{\theta}-\theta n\bar y\right]\mathbf1_{x_{(1)},y_{(1)}>0}\quad,\,\theta>0 \end{align} θθ\theta 의 최대 우도 추정값은 다음 과 같이 도출 될 수 있습니다. θ^(X,Y)=X¯¯¯¯Y¯¯¯¯−−−√θ^(X,Y)=X¯Y¯\hat\theta(\mathbf X,\mathbf Y)=\sqrt\frac{\overline X}{\overline Y} 이 MLE의 제한 …

2
ARMA-GARCH 모델을 사용하여 외환 가격 시뮬레이션
ARIMA (1,1,1) -GARCH (1,1) 모델을 몇 년에 걸쳐 1 분 간격으로 샘플링 된 AUD / USD 환율 로그 가격의 시계열에 맞추 었습니다. 모델을 추정 할 수있는 수백만 개의 데이터 포인트. 데이터 집합을 사용할 수 있습니다 여기에 . 명료하게하기 위해, 이것은 로그 가격의 1 차 통합으로 인해 로그 리턴에 적합한 ARMA-GARCH …

2
Neyman-Pearson의 명예는 왜 정리가 아닌 명예인가?
이것은 기술적 인 질문보다 역사 질문에 가깝습니다. 왜``Neyman-Pearson lemma ''가 정리가 아닌 Lemma입니까? 위키 링크 : https://en.wikipedia.org/wiki/Neyman%E2%80%93Pearson_lemma NB : 질문은 하지 하지만 Neyman - 피어슨 보조 정리의 역사에 대해, 표제어과 보조 정리는 정리를 증명하기 위해 사용되는 방법 일에 대해. 정리를 증명하는 데 사용되었는데 더 유용 했습니까? 이것이 사실이라는 의심의 여지가없는 …

5
모든 비용으로 비닝을 피해야하는 이유는 무엇입니까?
비닝을 항상 피해야하는 이유에 대한 몇 가지 게시물을 읽었습니다 . 이 링크에 대한 해당 주장에 대한 대중적인 참조 . 비닝 포인트 (또는 컷 포인트)는 결과적으로 손실되는 정보뿐만 아니라 임의적이며 스플라인이 선호되어야합니다. 그러나 현재 Spotify API를 사용하고 있습니다. Spotify API는 여러 기능에 대한 지속적인 자신감 측정 방법이 있습니다. 하나의 기능 "instrumentalness"를 …

2
퍼지 로직은 어떻게 되었습니까?
퍼지 로직 은 내가 대학원에있을 때 (2000 년대 초) 기계 학습 및 데이터 마이닝 분야에서 활발한 연구 분야처럼 보였다. 퍼지 추론 시스템, 퍼지 c- 평균, 다양한 신경망의 퍼지 버전 및 지원 벡터 머신 아키텍처는 모두 대학원 과정에서 강의되었으며 회의에서 논의되었습니다. ML에 다시 관심을 갖기 시작한 이후 (~ 2013 년) 퍼지 …

4
“랜덤 프로젝션”은 엄밀히 프로젝션이 아닌가?
랜덤 투영 알고리즘의 현재 구현에서 그들을 매핑하여 데이터 샘플들의 차원을 감소 에 사용하여 A 투영 행렬 그 항목에서, 예를 들어 적절한 분포 (에서 IID됩니다 ) :RdRd\mathbb R^dRkRk\mathbb R^kd×kd×kd\times kRRRN(0,1)N(0,1)\mathcal N(0,1) x′=1k√xRx′=1kxRx^\prime = \frac{1}{\sqrt k}xR 편리하게도,이 매핑은 대략 쌍 거리를 유지한다는 이론적 증거가 존재합니다. 그러나 최근 저자가 무작위 행렬을 사용한이 매핑이 …

7
모델 구축에서 사회적 차별을 피하십시오
아마존의 최근 채용 스캔들에서 영감을 얻은 질문이 있는데, 채용 과정에서 여성에 대한 차별로 기소되었습니다. 더 많은 정보는 여기에 : Amazon.com Inc의 머신 러닝 전문가는 큰 문제를 발견했습니다. 새로운 채용 엔진은 여성을 좋아하지 않았습니다. 이 팀은 2014 년부터 최고 인재 검색을위한 기계화를 목표로 취업 지원자의 이력서를 검토하기 위해 컴퓨터 프로그램을 구축해 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.