통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
연속 단어 모음에 대한 질문
이 문장을 이해하는 데 문제가 있습니다. 제안 된 첫 번째 아키텍처는 피드 포워드 NNLM과 유사합니다. 여기서 비선형 히든 레이어가 제거되고 프로젝션 레이어는 프로젝션 매트릭스뿐만 아니라 모든 단어에 대해 공유됩니다. 따라서 모든 단어가 같은 위치에 투영됩니다 (그들의 벡터는 평균화됩니다). 프로젝션 레이어와 프로젝션 매트릭스는 무엇입니까? 모든 단어가 같은 위치에 투사된다는 것은 무슨 …

2
시계열에서 계절성을 제거해야하는 이유는 무엇입니까?
시계열로 작업하는 동안 스펙트럼 분석을 사용하여 계절성을 감지하고 제거하는 경우가 있습니다. 나는 시계열의 진정한 초보자이며 왜 원래 시계열에서 계절성을 제거하고 싶습니까? 계절성을 제거하지 않으면 원래 데이터가 왜곡되지 않습니까? 계절성을 제거하여 시계열을 구성하면 어떤 이점이 있습니까?

2
Fisher의 정확한 검정은 어떤 분포를 가정합니까?
필자의 작업에서 Fisher의 정확한 테스트를 여러 번 사용한 것을 보았으며 데이터에 얼마나 적합한 지 궁금했습니다. 몇 가지 출처를 살펴보면 통계를 계산하는 방법을 이해했지만 귀무 가설에 대한 명확하고 공식적인 설명은 보지 못했습니다. 누군가가 가정 배포판에 대한 공식적인 설명을 설명하거나 저에게 설명 할 수 있습니까? 우발 사태 표의 값에 대한 설명에 감사드립니다.

2
의사 결정 트리를 갖춘 이유는 무엇입니까?
분류 작업 및 특히 Adaboost에 대한 부스팅 알고리즘에 대해 조금 읽었습니다. Adaboost의 목적은 여러 "약한 학습자"를 대상으로하고 훈련 데이터에 대한 일련의 반복을 통해 분류자를 밀어 모델 (들)이 반복적으로 실수를 저지르는 클래스를 예측하는 법을 배우도록하는 것입니다. 그러나 내가 한 많은 독서가 왜 의사 결정 트리를 약한 분류기로 사용했는지 궁금합니다. 특별한 이유가 …

2
컨볼 루션은 왜 작동합니까?
나는 우리가 독립 확률 변수의 합의 확률 분포 찾으려면 것을 알 수 있도록 , 우리의 확률 분포에서 그것을 계산할 수 와 말해서,X YX+YX+YX + YXXXYYY fX+Y(a)=∫∞x=−∞fX,Y(X=x,Y=a−x) dx=∫∞x=−∞fX(x)fY(a−x) dxfX+Y(a)=∫x=−∞∞fX,Y(X=x,Y=a−x) dx=∫x=−∞∞fX(x)fY(a−x) dxf_{X + Y}(a) = \int_{x = -\infty}^{\infty} f_{X, Y}(X = x, Y = a - x)~dx = \int_{x = -\infty}^{\infty} f_X(x) …

1
의사 난수 생성에서 시드 설정에 대한 참조 및 모범 사례
에서 이 문서 , 그 우려은 "세트 씨"명령은 STATA 사람들은 의사 난수를 생성하는 씨앗의 설정과 관련된 문제에 대해 설명합니다. 주목할만한 "하지 말아야 할 것" 은 일련의 자연수를 씨앗으로 연속적으로 사용하지 않습니다. 이것은 패턴을 가지고 의사 난수를 위험에 빠뜨리기 때문 입니다. 4 분의 1의 농담으로 주목할만한 "do" 는 일생 동안 단 …

2
로그 홀수 분포 란 무엇입니까?
기계 학습에 관한 교과서를 읽고 있는데 (데이터 마이닝 (Witten, et al., 2011))이 구절을 보았습니다. 또한, 다른 분포를 사용할 수 있습니다. 정규 분포는 일반적으로 숫자 속성에 적합한 선택이지만 미리 결정된 최소값은 있지만 상한이없는 속성에는 적합하지 않습니다. 이 경우 "log-normal"분포가 더 적합합니다. 위와 아래에 묶인 숫자 속성은 "log-odds" 분포 로 모델링 할 …

2
선형 회귀 분석에서 이진 / 이분법 독립 예측 변수에 대한 잔차 분석을 수행하는 방법은 무엇입니까?
나는 기금 관리 수익을 예측하기 위해 R에서 아래의 다중 선형 회귀를 수행하고 있습니다. reg <- lm(formula=RET~GRI+SAT+MBA+AGE+TEN, data=rawdata) 여기서는 GRI와 MBA 만 이진 / 이분법 예측 변수입니다. 나머지 예측 변수는 연속적입니다. 이 코드를 사용하여 이진 변수에 대한 잔차 그림을 생성하고 있습니다. plot(rawdata$GRI, reg$residuals) abline(lm(reg$residuals~rawdata$GRI, data=rawdata), col="red") # regression line (y~x) plot(rawdata$MBA, …


3
정밀 회수 곡선에 적합한 AUC는 무엇입니까?
매우 불균형 한 데이터 집합 (9 % 긍정적 결과)이 있기 때문에 ROC 곡선보다 정밀 회수 곡선이 더 적합하다고 결정했습니다. PR 곡선 아래에서 면적의 비슷한 요약 측정 값을 얻었지만 (관심이 있다면 .49) 해석 방법을 잘 모르겠습니다. 0.8 이상이 ROC에 대한 좋은 AUC라고 들었습니다.하지만 정밀 리콜 곡선에 대한 AUC의 일반 컷오프는 동일합니까?

2
대립 가설을 받아 들일 수 있습니까?
여기 몇 가지 관련 질문 알고 있어요 (예를 들면, 가설이 null을 둘러싼 용어를 테스트 , 그것은? 널 가설을 증명하는 것이 가능 하지만 아래에있는 내 질문에 대한 명확한 답을 알고하지 않습니다). 동전이 공정한지 여부를 테스트하려는 가설 테스트를 가정합니다. 우리는 두 가지 가설이 있습니다. H0: P ( H E D) = 0.5H0:p(head)=0.5H_0: …


2
평균과 분산이 알려진 경우 이변 량 정규 데이터의 공분산에 대한 최대 우도 추정치는 무엇입니까?
평균이 0이고 분산이 1 인 이변 량 정규 분포의 랜덤 표본이 있으므로 알 수없는 유일한 매개 변수는 공분산입니다. 공분산의 MLE는 무엇입니까? 나는 그것이 같은 것을해야한다 알고 하지만 우리가 어떻게 알 수 있습니까?1n∑nj=1xjyj1n∑j=1nxjyj\frac{1}{n} \sum_{j=1}^{n}x_j y_j

1
각도 / 원형 데이터의 회귀
목표가 각도 인 학습 문제를 감독했습니다. 간단한 회귀 분석을 수행하면 360과 1의 숫자가 내 모델에서 멀리 떨어져 있지만 실제로는 근접하고 x와 y 좌표를 예측하는 것이 좋지 않습니다. 여기서 하나의 숫자 만 예측하려고하기 때문입니다. 그러한 문제를 해결하는 올바른 방법은 무엇입니까?

1
Granger 인과성 테스트 지연 명령
개발중인 ARIMAX 모델에 포함시킬 수있는 여러 독립 변수를 고려하고 있다고 가정합니다. 다른 변수를 피팅하기 전에 Granger 테스트를 사용하여 역 인과 관계를 나타내는 변수를 선별하고 싶습니다 ( R granger.test의 MSBVAR패키지에서 함수를 사용하고 있지만 다른 암시가 비슷하게 작동한다고 생각합니다). 테스트해야하는 지연 수는 어떻게 결정합니까? R 함수는 다음 granger.test(y, p)과 같습니다 . 여기서 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.