통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
점근 적 편견과 일관성의 차이점은 무엇입니까?
서로를 의미합니까? 그렇지 않다면, 하나는 다른 것을 의미합니까? 왜 안돼? 이 문제는 내가 여기에 게시 한 답변에 대한 의견에 대한 답변으로 제기되었습니다 . Google에서 관련 용어를 검색해도 특히 유용한 것 같지는 않지만 수학 스택 교환에 대한 답변 을 발견했습니다. 그러나이 질문이이 사이트에도 적합하다고 생각했습니다. 주석을 읽은 후 편집 math.stackexchange 답변과 …

1
중앙 한계 정리가 단일 표본으로 작동하는 이유는 무엇입니까?
저는 샘플을 반복 할 때 CLT가 작동한다는 것을 항상 배웠습니다. 각 샘플은 충분히 큽니다. 예를 들어, 내가 1,000,000 시민의 나라를 가지고 있다고 상상해보십시오. CLT에 대한 나의 이해는 신장 분포가 정상이 아니더라도 50 명의 표본 1000 개를 채취 한 경우 (즉, 각각 50 명의 시민을 대상으로 한 1000 번의 조사를 실시한 …


1
네트워크 메타 분석에 가장 적합한 방법은 무엇입니까?
네트워크 메타 분석 또는 혼합 처리 비교를 수행하기위한 여러 가지 접근 방식이 있습니다. 가장 일반적으로 사용되고 액세스 가능한 항목은 다음과 같습니다. 베이지안 프레임 워크에서 : WinBUGS에서의 처리 별 설계 상호 작용 접근법 (예 : Jackson et al ); WinBUGS에서의 계층 적 팔 기반 베이지안 모델링 (예 : Zhao et al …

3
신경망에 대한 인코딩 날짜 / 시간 (순환 데이터)
신경망의 이벤트 날짜와 시간을 어떻게 인코딩합니까? 연속 시계열이 없지만 날짜 및 시간이있는 일부 이벤트가 있으며 관심 분야를 분석합니다. 이 관심사는 아침과 저녁에 차이가 있으며 주중, 여름과 겨울, 크리스마스와 부활절 전과는 다릅니다. 그리고 이벤트 자체는 시간이 지남에 따라 강력한 불균일 한 분포를 가지고 있습니다 (주간에 더 많은 종류, 밤에 더 많은 …

5
비주기적인 시계열의 추세를 분석하는 방법
비 주기적 시계열을 따르고 있다고 가정하십시오. 분명히 추세가 감소하고 있으며 일부 테스트 ( p-value 사용 ) 로 증명하고 싶습니다 . 값 사이의 강한 시간적 (직렬) 자동 상관으로 인해 고전적인 선형 회귀를 사용할 수 없습니다. library(forecast) my.ts <- ts(c(10,11,11.5,10,10.1,9,11,10,8,9,9, 6,5,5,4,3,3,2,1,2,4,4,2,1,1,0.5,1), start = 1, end = 27,frequency = 1) plot(my.ts, col = …
12 r  time-series 

2
베이지안 방법은 본질적으로 순차적입니까?
즉, 잦은 방법으로 순차적 분석 (수집 할 데이터의 양을 정확히 알지 못함)을 수행하려면 특별한주의가 필요합니다. p- 값이 충분히 작아 지거나 신뢰 구간이 충분히 짧아 질 때까지 데이터를 수집 할 수 없습니다. 그러나 베이지안 분석을 할 때 이것이 문제입니까? 신뢰할 수있는 간격이 충분히 작아 질 때까지 데이터 수집과 같은 작업을 자유롭게 …


1
Scikit predict_proba 출력 해석
파이썬에서 scikit-learn 라이브러리를 사용하고 있습니다. 아래 코드에서 확률을 예측하고 있지만 출력을 읽는 방법을 모르겠습니다. 테스트 데이터 from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) 데이터 세트 나누기 X_train, X_test, y_train, y_test = cross_validation.train_test_split(X, y, test_size=0.5, random_state=0) 확률 계산 clf = RF() clf.fit(X_train,y_train) …

1
LASSO에서 정규화 매개 변수의 범위 및 그리드 밀도 선택
그동안 LASSO (최소 절대 축소 및 선택 연산자)를 공부하고 있습니다. 정규화 매개 변수의 최적 값은 교차 유효성 검사를 통해 선택할 수 있습니다. 능선 회귀 분석과 정규화를 적용하는 많은 방법에서 CV를 사용하여 최적의 정규화 매개 변수 (벌칙)를 찾을 수 있습니다. 이제 내 질문은 매개 변수의 상한 및 하한의 초기 값과 시퀀스 …



1
피셔의 정확한 테스트는 균일하지 않은 p- 값을 제공합니다
시뮬레이션 된 유전학 문제에서 Fisher의 정확한 테스트를 적용하려고하지만 p- 값이 오른쪽으로 치우친 것으로 보입니다. 생물 학자로서, 나는 모든 통계 학자에게 명백한 것을 놓치고 있다고 생각합니다. 그래서 나는 당신의 도움에 크게 감사하겠습니다. 내 설정은 다음과 같습니다 (설정 1, 한계는 고정되지 않음) R에서 무작위로 0과 1의 두 샘플이 생성됩니다. 각 샘플 n …

1
부분
다음은 mtcars데이터 세트 에서 생성 된 모델입니다 . > ols(mpg~wt+am+qsec, mtcars) Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination Ratio Test Indexes Obs 32 LR chi2 60.64 R2 0.850 sigma 2.4588 d.f. 3 R2 adj 0.834 d.f. 28 Pr(> chi2) …

3
평균 및 분산을 알 수없는 정규 분포의 Jeffreys Prior
사전 분포를 읽고 있으며 평균 및 분산이 알려지지 않은 정규 분포 확률 변수의 표본에 대해 Jeffreys를 미리 계산했습니다. 내 계산에 따르면 다음은 Jeffreys 이전에 보유한 것입니다. 여기서 Fisher의 정보 매트릭스입니다.나는p ( μ , σ2) = de t ( 나는)−−−−−√= de t ( 1 / σ2001 / ( 2 σ4))−−−−−−−−−−−−−−−−−−√= 12 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.