통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
정규 분포를 제공하는 독립 분포의 비율
두 개의 독립 정규 분포의 비율은 Cauchy 분포를 제공합니다. t- 분포는 정규 분포를 독립 카이 제곱 분포로 나눈 값입니다. 두 개의 독립 카이 제곱 분포의 비율은 F- 분포를 제공합니다. 평균 및 분산 로 정규 분포 확률 변수를 제공하는 독립 연속 분포 의 비율을 찾고 있습니까?σ 2μμ\muσ2σ2\sigma^2 아마도 가능한 대답이 무한히있을 …

1
GBM 예측 간격을 찾는 방법
캐럿 패키지를 사용하여 GBM 모델로 작업하고 있으며 예측 데이터의 예측 간격을 해결하는 방법을 찾고 있습니다. 나는 광범위하게 검색했지만 Random Forest의 예측 간격을 찾기위한 몇 가지 아이디어 만 제시했습니다. 어떤 도움 / R 코드라도 대단히 감사하겠습니다!

3
선형 회귀 분석에 사용되는 가우스 기본 함수 매개 변수 이해
가우스 기저 함수를 선형 회귀 구현에 적용하고 싶습니다. 불행히도 기본 기능의 몇 가지 매개 변수를 이해하는 데 어려움을 겪고 있습니다. 구체적으로 μμ\mu 및 σσ\sigma 입니다. 내 데이터 세트는 10,000 x 31 행렬입니다. 10,000 개의 샘플과 31 개의 기능. "각 기본 함수는 입력 벡터 x를 스칼라 값으로 변환합니다"를 읽었습니다. 따라서 x는 …

3
트리밍 백분율 대 트리밍 평균의 플롯을 어떻게 해석 할 수 있습니까?
숙제 질문의 일부로, 가장 작고 큰 관측을 삭제하여 데이터 집합에 대한 트림 평균을 계산하고 결과를 해석하라는 요청을 받았습니다. 트리밍 된 평균은 트리밍되지 않은 평균보다 낮았습니다. 내 해석은 기본 분포가 긍정적으로 비뚤어져 있기 때문에 왼쪽 꼬리가 오른쪽 꼬리보다 밀도가 높기 때문입니다. 이 왜도의 결과로 높은 데이텀을 제거하면 낮은 데이텀을 제거하는 것보다 …

1
피셔 정보 결정자
(나는 math.se에 비슷한 질문을 게시했습니다 .) 정보 지오메트리에서 Fisher 정보 매트릭스의 결정 요인은 통계적 매니 폴드의 자연스러운 체적 형태이므로 멋진 기하학적 해석이 가능합니다. 예를 들어, 제프리스의 정의에 나타난 사실은 (재호) 기하 적 속성 인 재 파라미터 화에 따른 차이와 관련이있다. 그러나 통계 에서 그 결정 요인은 무엇 입니까? 의미있는 것을 …


2
SAS PROC GLIMMIX가 이항 glmm에 대해 glmer (lme4)와 다른 임의의 기울기를 제공하는 이유는 무엇입니까?
저는 R에 더 익숙한 사용자이며 4 개의 서식지 변수에 대해 5 년 동안 약 35 명의 개인에 대한 임의의 기울기 (선택 계수)를 추정하려고했습니다. 응답 변수는 위치가 "사용 된"(1) 또는 "사용 가능한"(0) 서식지 (아래 "사용") 여부입니다. Windows 64 비트 컴퓨터를 사용하고 있습니다. R 버전 3.1.0에서는 아래 데이터와 표현식을 사용합니다. PS, TH, …

4
특이 치를 제거하기에 좋은 형태?
소프트웨어 빌드 통계를 작성 중입니다. 통과 / 실패 및 경과 시간에 대한 각 빌드에 대한 데이터가 있으며 주당 ~ 200 개를 생성합니다. 성공률은 집계하기 쉽습니다. 45 %가 특정 주에 통과했다고 말할 수 있습니다. 그러나 경과 시간도 집계하고 싶습니다. 데이터를 너무 잘못 표시하지 않도록하고 싶습니다. 나는 프로에게 더 잘 물어 볼 …

3
및 잔류 이탈 자유도를 사용하여 로지스틱 회귀 계수 테스트
요약 : 표준 정규 분포가 아닌 로지스틱 회귀 계수의 테스트에 분포 (잔류 편차를 기반으로 한 자유도)를 사용하도록 지원하는 통계 이론이 있습니까?ttt 얼마 전에 SAS PROC GLIMMIX의 로지스틱 회귀 모델을 피팅 할 때 기본 설정에서 로지스틱 회귀 계수가 표준 정규 분포가 아닌 분포를 사용하여 테스트됨을 발견했습니다 . 즉, GLIMMIX는 비율이 ( …

1
R에서 중개 분석의 종합적인 결과
패키지의 비 네트를 사용하여 R의 중개 패키지를 둘러 보려고합니다. mediate()함수 의 출력을 이해하는 데 어려움을 겪고 있습니다. require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age + educ + gender + …
12 r  mediation 

4
트렌드 고정 시리즈를 ARIMA로 모델링 할 수 있습니까?
ARIMA (X)로 모델링하는 데 필요한 고정 시리즈에 대한 질문 / 혼란이 있습니다. 나는 이것을 추론 (interference)의 영향에 대해 더 많이 생각하고 있지만 예측 대 추론이 반응에 어떤 차이가 있는지 알고 싶다. 질문: 내가 읽은 모든 입문 자료는 시리즈가 고정되어 있어야한다는 말을 들었다. 이는 나에게 의미가 있고 그것이 arima의 "I"가 들어오는 …

3
데이터를 제로 평균으로 만드는 아이디어
나는 종종 모든 요소에서 평균을 제거하여 데이터 세트의 차원 / 기능을 만드는 사람들이 제로 평균임을 알 수 있습니다. 그러나 나는 왜 그렇게 해야하는지 이해하지 못했습니까? 전처리 단계로 수행하면 어떤 효과가 있습니까? 분류 성능이 향상됩니까? 데이터 세트에 대한 답변에 도움이 되나요? 시각화를 수행 할 때 데이터를 이해하는 데 도움이됩니까?

2
이산 데이터에 선 그림을 사용하는 것이 잘못 되었습니까?
나는 종종 개별 데이터 세트를 선 플롯으로 표시하는 것을 보았지만, 선이 측정 간격 사이의 지점에서 값을 유추하여 개별 데이터 세트에 의미가없는 것으로 나타났습니다. 따라서 이산 데이터에 선 그림을 사용하는 것이 잘못 되었습니까? 예를 들어, 두 개의 시계열 데이터 세트를 사용하십시오. 하나는 연속 (내 무게는 매일 아침 측정)과 하나는 분리합니다 (하루에 …

3
데이터를 재구성하고 재구성하는 가장 좋은 방법은 무엇입니까?
저는 실험실 (자원 봉사자)의 연구 조교입니다. 저와 소규모 그룹은 대규모 연구에서 가져온 일련의 데이터에 대한 데이터 분석 작업을 수행했습니다. 불행히도 데이터는 일종의 온라인 앱으로 수집되었으며 가장 유용한 형식으로 데이터를 출력하도록 프로그래밍되지 않았습니다. 아래 그림은 기본적인 문제를 보여줍니다. 나는 이것을 "개조"또는 "구조 변경"이라고 들었다. 질문 : 10k가 넘는 항목이있는 대용량 데이터 …
12 r  excel  data-cleaning 

2
정규 분포 X와 Y는 정규 분포 잔차를 더 많이 발생합니까?
여기서 선형 회귀 분석에서 정규성의 가정에 대한 잘못된 해석이 논의되고 ( '정규'는 잔차가 아닌 X 및 / 또는 Y를 나타냄) 포스터는 정규 분포가 아닌 X와 Y를 가질 수 있는지 묻습니다. 여전히 정규 분포 잔차가 있습니다. 내 질문은 : 정규 분포 X와 Y 가 정규 분포 잔차를 초래할 가능성 이 더 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.