통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
헤어 드레서의 수수께끼
저의 미용사 인 스테이시는 항상 행복한 표정을 짓지 만 종종 그녀의 시간 관리에 스트레스를받습니다. 오늘 Stacey는 나의 약속에 대해 기한이 지났고 매우 사과했습니다. 내 이발을받는 동안 나는 그녀의 표준 약속이 얼마나 오래 걸리나요? (깨끗한 라운드 번호에 대한 고객의 선호가 잠시 무시 될 수있는 경우). 고려해야 할 사항은 매우 늦은 고객이 …

3
어떻게에서 가장 큰 용어에
고려 ∑엔나는 = 1| 엑스나는|∑i=1N|Xi|\sum_{i=1}^N |X_i| 여기서 엑스1, … , X엔X1,…,XNX_1, \ldots, X_N 은 iid이고 CLT는 유지합니다. 가장 큰 항의 총합이 총합의 절반에 합됩니까? 예를 들어, 10 + 9 + 8 ≈≈\approx (10 + 9 + 8 ……\dots + 1) / 2 : 용어의 30 %가 전체의 절반에 도달합니다. 밝히다 …

4
병원 기반 RCT에서 체류 기간 데이터를 가장 잘 분석하는 방법은 무엇입니까?
RCT에서 입원 기간 (LOS) 데이터를 분석하는 최적의 방법에 대한 합의가 있는지 여부에 관심이 있습니다. 이것은 일반적으로 오른쪽으로 치우친 분포로 대부분의 환자는 며칠에서 일주일 이내에 퇴원하지만 나머지 환자는 예측할 수없는 (때로는 꽤 긴) 체류 기간이있어 분포의 오른쪽 꼬리를 형성합니다. 분석 옵션은 다음과 같습니다. t 테스트 (존재하지 않을 것으로 가정) 맨 휘트니 …

1
Hoeffding 불평등에 사용 된 정리의 증거 이해
Casella와 Berger를 기본 텍스트로 사용하는 통계에 대한 Larry Wasserman의 강의 노트 를 연구하고 있습니다. 나는 그의 강의 노트 세트 2를 진행 하고 있으며 Hoeffding의 불평등 (pp.2-3)에 사용 된 정리의 파생에 갇혀있다. 나는 아래의 메모에서 증거를 재현하고 있으며 증거 후에 내가 붙어있는 곳을 지적합니다. 렘마 한다고 가정 , 그 . 그런 …

2
lm에 대한 기본 진단 플롯의 가능한 확장은 무엇입니까 (R 및 일반적으로)?
나는 plot.lm 함수에 비트를 파기 시작했습니다 .이 함수는 lm에 대한 6 개의 플롯을 제공합니다. 적합치에 대한 잔차 그림 적합치에 대한 sqrt (| 잔차 |)의 스케일 위치 플롯 일반 QQ 플롯, Cook의 거리와 행 레이블의 플롯 레버리지에 대한 잔차 그림 레버리지 / (1- 레버리지)에 대한 Cook의 거리 플롯 그리고 선형 모델에 …

1
증분 IDF (역 문서 빈도)
텍스트 마이닝 응용 프로그램에서 간단한 접근 방법 중 하나는 휴리스틱을 사용하여 문서의 간결한 스파 스 표현으로 벡터를 만드는 것입니다. 에 전체 코퍼스가 필요하기 때문에 전체 코퍼스가 선험적으로 알려진 배치 설정에 적합 합니다.tf−idftf−idftf-idfidfidfidf idf(t)=log|D||{d:t∈d}|idf(t)=log⁡|D||{d:t∈d}| \mathrm{idf}(t) = \log \frac{|D|}{|\{d: t \in d\}|} 여기서 는 용어, 는 문서, 는 문서 모음, (표시되지 않음)는 …

1
무 팽창 포아송 분포의 평균 및 분산
확률 질량 함수를 사용하여 제로 팽창 포아송의 예상 값과 분산이 어떻게 표시되는지 f(y)={π+(1−π)e−λ,(1−π)λye−λy!,if y=0if y=1,2....f(y)={π+(1−π)e−λ,if y=0(1−π)λye−λy!,if y=1,2.... f(y) = \begin{cases} \pi+(1-\pi)e^{-\lambda}, & \text{if }y=0 \\ (1-\pi)\frac{\lambda^{y}e^{-\lambda}}{y!}, & \text{if }y=1,2.... \end{cases} 여기서 는 이항 공정에 의해 관측치가 0 일 확률이고 는 포아송의 평균입니다.λππ\piλλ\lambda 결과는 예상 값 이며 분산은 입니다.μ + πμ=(1−π)λμ=(1−π)λ\mu …

3
영화 등급 예측을위한 분류 모델
데이터 마이닝에 익숙하지 않고 영화 등급 예측을위한 분류 모델을 만들고 있습니다. IMDB에서 데이터 세트를 수집했으며 모델에 의사 결정 트리와 가장 가까운 인접 방법을 사용할 계획입니다. 무료로 사용할 수있는 데이터 마이닝 도구가 필요한 기능을 제공 할 수 있는지 알고 싶습니다.

1
시계열의 자기 상관 함수에서 읽어야 할 내용은 무엇입니까?
시계열이 주어지면 자기 상관 함수를 추정하고 예를 들어 아래와 같이 플롯 할 수 있습니다. 그러면이 자기 상관 함수에서 시계열에 대해 무엇을 읽을 수 있습니까? 예를 들어 시계열의 정상 성을 추론하는 것이 가능합니까? 편집 : 여기에 더 많은 지연이있는 차이 시리즈의 ACF가 포함되었습니다.

2
범주 형 변수 간의 공선 성
연속 예측 변수와 관련하여 공선 성이 많지만 범주 형 예측 변수에서는 찾을 수 없습니다. 아래에이 유형의 데이터가 있습니다. 첫 번째 요인은 유전 적 변수 (대립 유전자 수)이고 두 번째 요인은 질병 범주입니다. 분명히 유전자가 질병보다 우선하며 진단으로 이어지는 증상을 나타내는 요인입니다. 그러나 SPSS와 관련하여 일반적으로 수행되는 II 또는 III 제곱합을 …

1
원래 데이터를 입력으로 사용할 때 R의 predict () 함수가 반환하는 예측 값은 무엇입니까?
reg <- lm(y ~ x1 + x2, data=example)데이터 집합 에서 양식의 회귀를 실행 한 후 다음을 사용하여 예측 값을 얻을 수 있습니다 predict(reg, example, interval="prediction", level=0.95) 실제 데이터 세트를 예측하기 위해 회귀를 사용할 때 예측 값이 실제로 무엇을 나타내는 지 궁금합니다. 원래 값을 얻어야합니까?
11 r  regression 

1
시계열 차이에 대한 신뢰 구간
일부 프로세스의 시계열을 시뮬레이션하는 데 사용되는 확률 모델이 있습니다. 하나의 매개 변수를 특정 값으로 변경하는 효과에 관심이 있고 시계열 (예 : 모델 A 및 모델 B)과 일종의 시뮬레이션 기반 신뢰 구간 간의 차이를 표시하려고합니다. 나는 단순히 모델 A와 모델 B에서 많은 시뮬레이션을 실행 한 다음 각 시점에서 중앙값을 빼서 시간에 …

2
무 팽창 감마 모델의 올바른 사용 및 해석
배경 : 저는 현재 세포 발현률의 데이터 세트로 씨름하고있는 생물 통계 학자입니다. 이 연구 는 다양한 공여자로부터 그룹 으로 수집 된 다수의 세포 를 특정 펩티드에 노출시켰다 . 세포는 반응에 따라 특정 바이오 마커를 발현하거나 그렇지 않다. 그런 다음 각 공여자 그룹에 대한 응답 속도가 기록됩니다. 반응 속도 (백분율로 표시)는 …

7
상관 관계가 인과 관계를 의미하지 않는 경우 두 변수 간의 상관 관계를 아는 값은 무엇입니까?
비즈니스 소유자 (또는 마케팅 또는 산점도를 이해하는 사람)에게 두 가지 변수의 산점도를 표시한다고 가정 해 보겠습니다. 광고 수 대 지난 5 년간 한 달에 한 달에 제품 판매 수 (또는 다른 시간 척도) 더 많은 샘플을 가지고 있습니다. 이제 산포도를보고 상관 계수 (corr)는 다음과 같습니다. 1 또는 0.5 또는 0.11 …

3
R로 와플 차트를 만드는 방법?
잠김 . 이 질문과 주제는 주제가 다르지만 역사적으로 중요하기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. R에서 원형 차트를 사용하는 대신 와플 차트를 플로팅하려면 어떻게해야합니까? help.search("waffle") No help files found with alias or concept or title matching ‘waffle’ using fuzzy matching. 내가 찾은 가장 가까운 인터넷 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.