통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

5
검열 된 데이터는 정확히 무엇입니까?
검열 데이터에 대한 다른 설명을 읽었습니다. A) 이 스레드 에서 설명한 바와 같이, 특정 임계 값 이하의 정량화되지 않은 데이터가 검열됩니다. 정량화되지 않음은 데이터가 특정 임계 값보다 높거나 낮음을 의미하지만 정확한 값을 모릅니다. 그런 다음 회귀 모델 에서 데이터가 하한 또는 상한 임계 값 으로 표시됩니다 . 이 설명과 일치합니다 …

3
부트 스트랩 : 과적 합 문제
대체로 원래 관측치 로부터 각각 크기 의 샘플을 추출 하여 소위 비모수 적 부트 스트랩을 수행한다고 가정합니다 . 이 절차는 경험적인 cdf에 의한 누적 분포 함수를 추정하는 것과 같습니다.BBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function 그리고 추정 된 cdf 시간 으로부터 관측치를 연속 으로 시뮬레이션함으로써 부트 스트랩 샘플을 획득하는 단계 를 포함한다.nnnBBB 내가 이것에 옳다면 …

1
QQ 라인의 신뢰 대역
이 질문은 구체적으로 관련이 R없지만 R설명 하기 위해 사용 하기로 선택 했습니다. (일반) qq- 라인에서 신뢰 대역을 생성하는 코드를 고려하십시오. library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") 이 신뢰 대역이 어떻게 구성되어 있는지에 대한 설명 (또는 대안 문서 / 온라인 문서 링크)을 찾고 있습니다 (R의 도움말 파일에서 Fox 2002에 대한 참조를 보았지만 슬프게도 …

2
k- 평균 대 k- 중간 값?
k- 평균 군집 알고리즘과 k- 중간 값이 있다는 것을 알고 있습니다. 하나는 평균을 군집의 중심으로 사용하고 다른 하나는 중앙값을 사용합니다. 내 질문은 언제 / 어디를 사용해야합니까?

4
배심원 선택의 편견?
배심원 선택이 인종적으로 편중 된 것으로 보이는 형사 재판 후 친구가 항소에 의뢰인을 대변하고 있습니다. 배심원 풀은 4 명의 인종 그룹에서 30 명으로 구성되었습니다. 검찰은 풀에서이 10 명을 제거하기 위해 선제 적 도전을 사용했다. 각 인종 그룹의 인원 수와 실제 과제 수는 각각 다음과 같습니다. A: 10, 1 B: 10, …

3
로지스틱 회귀 계수가 의미가 있습니까?
여러 기능에서 이진 분류 문제가 있습니다. (정규화 된) 로지스틱 회귀의 계수가 해석 가능한 의미가 있습니까? 기능이 미리 표준화되어 있기 때문에 영향의 크기를 나타낼 수 있다고 생각했습니다. 그러나 내 문제에서 계수는 선택한 기능에 민감하게 의존하는 것으로 보입니다. 계수의 부호조차도 입력으로 선택된 다른 피쳐 세트로 변경됩니다. 계수의 값을 검사하고 가장 의미있는 계수를 …

2
빈번한 통계의 주관성
나는 종종 베이지안 통계가 매우 주관적 일 수 있다는 주장을 듣는다. 추론의 주요 논점은 이전의 선택에 달려있다 (이전의 선택을 위해 최대 엔트로피의 무차별 원칙을 사용할 수 있음에도 불구하고). 이에 반해, 잦은 통계는 일반적으로 더 객관적이다. 이 진술에는 얼마나 많은 진리가 있습니까? 또한 이것은 나를 궁금하게합니다. 특히 주관적 일 수 있고 …

1
Gelman과 Rubin 수렴 진단, 벡터 작업을 일반화하는 방법?
Gelman 및 Rubin 진단은 병렬로 실행되는 여러 mcmc 체인의 수렴을 확인하는 데 사용됩니다. 체인 내 분산과 체인 간 분산을 비교하면 노출은 다음과 같습니다. 단계 (각 매개 변수) : 과도하게 분산 된 시작 값에서 길이 2n의 m ≥ 2 체인을 실행하십시오. 각 체인에서 첫 번째 n 추첨을 버리십시오. 체인 내 및 …

4
"상관"도 회귀 분석의 기울기를 의미합니까?
나는 논문을 읽고 있는데 저자는 다음과 같이 썼다. Y에 대한 A, B, C의 효과는 다중 회귀 분석을 사용하여 연구되었습니다. A, B, C를 Y를 종속 변수로하여 회귀 방정식에 입력했습니다. 분산 분석은 표 3에 제시되어있다. B가 Y와 .27을 상관시키면서 Y에 대한 B의 효과는 유의했다. 영어는 모국어가 아니며 여기서 정말 혼란스러워했습니다. 먼저 회귀 …

1
기계 학습 분류기 (big-O) 또는 복잡성
새로운 분류 알고리즘의 성능을 평가하기 위해 정확성과 복잡성을 비교하려고합니다 (훈련 및 분류에서 큰 O). 에서 기계 학습 : 리뷰는 내가 알고리즘 사이 또한, 정확성 테이블을 완전한 감독 분류 목록을 얻고, 44 시험 문제 UCI 데이터 repositoy . 그러나 다음과 같은 일반적인 분류 기준이 큰 리뷰, 종이 또는 웹 사이트를 찾을 …

1
Karl Pearson은 카이 제곱 통계량을 어떻게 얻었습니까?
Pearson은 1900 년에 다음과 같은 Pearson 카이 제곱 통계를 어떻게 얻었습니까? K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} that K∼χ2K∼χ2 K \sim \chi^2 그는 카이 제곱을 염두에두고 메트릭 KKK (하단 접근법)를 고안 했습니까, 아니면 통계를 고안 한 후 나중에 카이 제곱 분포 (위에서 아래로)를 따르는 지 증명 했습니까? 왜 그가 특정 …

3
경험적 확률 밀도 간의 중첩을 계산하는 방법은 무엇입니까?
두 샘플 간의 유사성을 측정하기 위해 R에서 두 커널 밀도 추정치 사이의 겹침 영역을 계산하는 방법을 찾고 있습니다. 명확히하기 위해, 다음 예에서, 자 p 중첩 영역의 면적을 정량화해야합니다. library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) ggplot(d, aes(value, fill=variable)) + geom_density(alpha=.4, color=NA) 비슷한 질문이 여기 에서 …

1
회귀 계수와 부분 회귀 계수의 차이점은 무엇입니까?
나는 Abdi (2003) 에서 독립 변수가 쌍으로 직교하는 경우, 회귀에서 각 변수의 효과는이 독립 변수와 종속 변수 사이의 회귀 기울기를 계산하여 평가됩니다. 이 경우에 (즉, IV의 직교성), 부분 회귀 계수는 회귀 계수와 동일하다. 다른 모든 경우에 회귀 계수는 부분 회귀 계수와 다릅니다. 그러나이 문서는이 두 가지 유형의 회귀 계수의 차이점이 …

3
생존 분석 문제에 대한 교육, 테스트, 검증
나는 여기에서 다양한 스레드를 탐색했지만 정확한 질문에 대답하지 않았다고 생각합니다. ~ 50,000 명의 학생 데이터와 이탈 시간이 있습니다. 잠재적 인 공변량이 많은 비례 위험 회귀 분석을 수행하려고합니다. 또한 중퇴 / 숙박에 대한 로지스틱 회귀 분석을 수행 할 예정입니다. 주요 목표는 새로운 학생 집단을 예측하는 것이지만, 작년의 집단과 크게 다를 것이라고 …

1
맥락 적 산적을위한 비용 함수
문맥 적 문제 를 해결하기 위해 vowpal Wabbit 을 사용 하고 있습니다 . 사용자에게 광고를 게재하고 있으며 광고가 게재되는 상황 (예 : 사용자가 누구인지, 어떤 사이트에 있는지 등)에 대한 정보가 상당히 있습니다. 이것은 John Langford에 의해 설명 된 것처럼 매우 고전적인 맥락 적 산적 문제인 것 같습니다 . 내 상황에서 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.