통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
중앙값이 [Mode-Mean] 밖에있는 예
이 기사 는 내 리그 위에 있지만 내가 관심있는 주제, 평균, 모드 및 중간 간의 관계에 대해 이야기합니다. 그것은 말한다 : 단봉 분포의 중앙값은 평균과 모드 사이에서 "보통"이라고 널리 알려져 있습니다. 그러나 이것은 항상 사실이 아닙니다 ... 내 질문 : 누군가 중앙값이 [모드, 평균] 간격을 벗어난 연속 단봉 형 (이상적으로 …
11 mean  median  mode 

3
정규 분포에 대한 왜도 및 첨도 값 범위
데이터가 정규 분포로 간주되는 왜도 및 첨도 값의 범위가 무엇인지 알고 싶습니다 . 나는 많은 논쟁을 읽었으며 대부분 혼란스러워했다. 첨도에 대한 왜도 및 는 정규 분포에 허용되는 범위입니다. 일부는 왜도가 허용되는 범위 라고 말합니다 . 여기서 자세한 논의를 찾았습니다 .이 문제와 관련된 데이터의 정상적인 분포에 대한 허용 가능한 왜도 및 …

2
Gelman & Carlin의 이해“비욘드 전력 계산 :…”(2014)
나는 Gelman & Carlin "Beyond Power Calculations : Assessing Type S (Sign) and Type M (Magnitude) Errors" (2014)를 읽고 있습니다. 나는 주요 아이디어, 주요 테이크 웨이를 이해하려고 노력하고 있지만 혼란스러워합니다. 누구든지 본질을 증류시키는 데 도움을 줄 수 있습니까? 종이는 이런 식으로 진행됩니다 (내가 올바르게 이해하면). 심리학의 통계 연구는 종종 작은 …

1
모드의 신뢰 구간을 계산 하시겠습니까?
모드 (일반적으로)의 신뢰 구간 계산에 대한 참조를 찾고 있습니다. 부트 스트랩은 당연한 첫 번째 선택 인 것처럼 보이지만 Romano (1988)에서 논의한 것처럼 표준 부트 스트랩은 모드에 실패하고 간단한 솔루션을 제공하지 않습니다. 이 논문 이후로 어떤 변화가 있었습니까? 모드의 신뢰 구간을 계산하는 가장 좋은 방법은 무엇입니까? 최고의 부트 스트랩 기반 접근 …

1
ACF, PACF 기능에 대한 용어 "잘라 내기"및 "꼬리 말기"
ACF 및 PACF의 시계열 그림에서 컷오프 및 테일 오프의 의미를 이해하려고합니다. "지연 후 차단"이란 무엇입니까? 이것에 대한 한계? "Tails off"는 무엇을 의미합니까? 위의 예에서, 내가 공부하기 위해 사용하고있는 책은 그것이 AR 과정이라고 말합니다. 그러나 나는 "잘라내 다"와 "꼬리를 벗다"의 의미를 알 수 없습니다


3
적합 곡선의 신뢰성?
적합 곡선의 불확실성 또는 신뢰성을 추정하고 싶습니다. 나는 그것이 무엇인지 모르기 때문에 내가 찾고있는 정확한 수학적 양을 의도적으로 언급하지 않습니다. 여기서 (에너지)는 종속 변수 (응답)이고 (볼륨)는 독립 변수입니다. 일부 재료 의 에너지-볼륨 곡선 를 찾고 싶습니다 . 그래서 나는 양자 화학 컴퓨터 프로그램을 사용하여 일부 샘플 볼륨 (플롯의 녹색 원)의 …

4
홀드 아웃 세트를 만드는 가장 적절한 방법은 무엇입니까? 일부 주제를 제거하거나 각 주제에서 관찰을 제거하는 방법은 무엇입니까?
26 개의 기능과 31000 개의 행이있는 데이터 집합이 있습니다. 38 명의 피험자 데이터 세트입니다. 생체 인식 시스템입니다. 그래서 나는 주제를 식별하고 싶습니다. 테스트 세트를 사용하려면 일부 값을 제거해야한다는 것을 알고 있습니다. 그래서 무엇을 더 잘하고 왜? (a) 30 명을 훈련 세트로 유지하고 8 명을 시험 세트로 제거 (b) 38 명의 …

1
K를 선택하면 왜 교차 검증 점수가 낮아 집니까?
주변에 재생 보스톤 주택 데이터 집합 와 RandomForestRegressor에 (w / 기본 매개 변수) 나는 이상한 뭔가를 발견, scikit 배우기 : 평균 교차 유효성 검사 점수가 감소 내가 내 교차 검증 전략 등이었다 다음 10 이상으로 주름의 수를 증가로 : cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... …

4
독립 로그 정규 확률 변수의 합이 로그 정규?
관측치 수가 증가함에 따라 두 개 이상의 로그 정규 확률 변수의 합이 로그 정규 분포에 접근하는 이유를 이해하려고합니다. 온라인에서 검색했는데 이에 관한 결과를 찾지 못했습니다. 분명히 와 가 독립적 인 로그 정규 변수라면 지수와 가우스 랜덤 변수의 속성에 의해 도 로그 정규입니다. 그러나 도 로그 정규 라고 제안 할 이유가 …

3
역변환보다는 Ahrens and Dieter (1972)의 방법을 사용하는 지수 랜덤 생성기의 장점은 무엇입니까?
내 질문은 R 의 내장 지수 난수 생성기 인 함수에서 영감을 얻었습니다 rexp(). 기하 급수적으로 분포 된 난수를 생성하려고 할 때 많은 교과서 에서이 Wikipedia 페이지에 요약 된 역변환 방법을 권장합니다 . 이 작업을 수행하는 다른 방법이 있다는 것을 알고 있습니다. 특히, R 의 소스 코드는 Ahrens & Dieter (1972) …

1
맥 러스트 모델 선택
R 패키지 mclust는 BIC를 클러스터 모델 선택의 기준으로 사용합니다. 내 이해에서 BIC가 가장 낮은 모델을 다른 모델보다 선택해야합니다 (BIC에만 관심이있는 경우). 그러나 BIC 값이 모두 음수 인 경우 Mclust함수는 기본적으로 BIC 값이 가장 높은 모델로 설정됩니다. 다양한 시험에서 얻은 전반적인 이해는 mclust"최고의"모델을 모델로 식별 한다는 것 입니다.max{BICi}max{BICi}max\{BIC_i\} 저자가 왜이 결정을했는지 …


2
두 가지 평균을 비교하기 위해 t- 검정 대신 분산 분석을 사용하는 것이 잘못 되었습니까?
저는 급여가 분포되어 있으며 남성과 여성의 평균 차이를 비교하고 싶습니다. 나는 두 가지 방법을 비교하기위한 학생 T- 테스트가 있다는 것을 알고 있지만 ANOVA를 제안한 후 ANOVA가 두 가지 이상의 방법을 비교한다는 비판을 받았습니다. 무엇 (어떤 경우)입니다 잘못 만이 수단을 비교하는 그것을 사용에?

3
Poisson GLM에 오프셋을 사용해야합니까?
두 가지 수중 시각 센서스 방법을 사용할 때 어류 밀도와 어종 풍부도의 차이를 조사하는 연구를 수행하고 있습니다. 내 데이터는 원래 데이터로 계산되었지만 일반적으로 물고기 밀도로 변경되었지만 여전히 Poisson GLM을 사용하기로 결정했습니다. model1 <- glm(g_den ~ method + site + depth, poisson) 3 개의 예측 변수는 입력 할 때 요인으로 주문한 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.