통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A



5
신뢰 구간 및 확률-이 문장의 오류는 어디에 있습니까?
누군가 다음과 같은 진술을하면 : "연기 환경 흡연에 노출 된 비 흡연자는 흡연에 노출되지 않은 비 흡연자에 비해 관상 동맥 심장 질환의 위험이 1.25 (95 % 신뢰 구간, 1.17-1.32)였습니다." 전체 인구에 대한 상대적 위험은 무엇입니까? 관상 동맥 심장병과 얼마나 많은 것들이 관련되어 있습니까? 테스트 할 수있는 수많은 것들 중에서 실제로 …



1
회귀 계수의 다변량 정규 분포?
회귀에 관한 교과서를 읽는 동안 나는 다음 단락을 만났다. 선형 회귀 계수 ( ) 의 벡터의 최소 제곱 추정값 은 다음과 같습니다.ββ\beta β^=(XtX)−1Xtyβ^=(XtX)−1Xty \hat{\beta} = (X^{t}X)^{-1}{X^t}y 데이터 의 함수로 볼 때 (예측 변수 X 를 상수로 간주 ) 데이터의 선형 조합입니다. 중앙 한계 정리를 사용하면 표본 크기가 크면 β 분포 …

2
Spearman 상관 관계가 Pearson보다 유한 한 양인 경우 무엇을 표시합니까?
관련 데이터 세트가 많이 있습니다. 쌍 간의 피어슨 상관 관계는 일반적으로 스피어 맨 상관 관계보다 확실히 큽니다. 그것은 어떤 상관 관계가 선형이라는 것을 암시하지만, 피어슨과 스피어 맨이 동일하더라도 기대할 수 있습니다. 피어슨과 스피어 맨 상관 사이에 명확한 간격이 있고 피어슨이 더 클 때 무엇을 의미합니까? 이것은 내 데이터 세트에서 일관된 …

1
nlmer ()를 사용하여 반복 측정 데이터에 비선형 혼합 효과 모델을 맞추려면 어떻게해야합니까?
반복 측정 데이터를 분석하려고 노력하고 R있습니다. 내 데이터는 본질적으로 다음과 같습니다. 두 개의 치료 그룹이 있습니다. 각 그룹의 모든 과목은 매일 시험을 치르며 점수 (시험에서 정확한 비율)를받습니다. 데이터는 긴 형식입니다. Time Percent Subject Group 1 0 GK11 Ethanol 2 0 GK11 Ethanol 3 0 GK11 Ethanol 4 0 GK11 Ethanol …

3
두 시계열의 관계 : ARIMA
다음 두 시계열 ( x , y ; 아래 참조)을 고려할 때이 데이터의 장기 추세 간의 관계를 모델링하는 가장 좋은 방법은 무엇입니까? 두 시계열은 시간의 함수로 모델링 할 때 중요한 Durbin-Watson 테스트를 가지고 있으며 고정적이지 않습니다. 나는 이것이 기본적으로 arima (1,1,0 ), arima (1,2,0) 등 나는 당신이 그것들을 모델링하기 전에 …


4
부트 스트랩, 몬테카를로
숙제의 일부로 다음 질문을 설정했습니다. 일 변량 데이터 표본의 평균에 대한 95 % 신뢰 구간을 얻기 위해 부트 스트랩의 성능을 검사하기위한 시뮬레이션 연구를 설계하고 구현합니다. 구현은 R 또는 SAS에있을 수 있습니다. 보고자하는 성능 측면은 신뢰 구간 적용 범위 (즉, 신뢰 구간에 실제 평균이 포함되는 비율)와 Monte Carlo 변동 (즉, 상한과 …

3
순열을 반복하지 않고 R에서 다시 샘플링하는 방법은 무엇입니까?
R에서 set.seed ()를 사용한 다음 샘플 함수를 사용하여 목록을 무작위 화하면 동일한 순열을 생성하지 않을 수 있습니까? 즉 ... set.seed(25) limit <- 3 myindex <- seq(0,limit) for (x in seq(1,factorial(limit))) { permutations <- sample(myindex) print(permutations) } 이것은 생산 [1] 1 2 0 3 [1] 0 2 1 3 [1] 0 …

2
랜덤 포레스트는 예측 편견을 나타 냅니까?
왜 또는 왜 그렇지 않을지에 대한 추론이 있지만 이것은 간단한 질문이라고 생각합니다. 내가 묻는 이유는 내가 최근에 자체 RF 구현을 작성했으며 그것이 잘 수행하더라도 예상 한 것만 큼 성능이 좋지 않다는 것입니다 ( Kaggle 사진 품질 예측 경쟁 데이터 세트, 우승 점수 및 일부 어떤 기술이 사용되었는지에 관한 후속 정보). …


5
기계 학습 문제를 프로토 타이핑하기 위해 어떤 프로그래밍 언어를 권장합니까?
현재 Octave에서 작업하고 있지만 문서화가 좋지 않아 진행 속도가 매우 느립니다. 어떤 언어는 배우고 사용하기 쉽고 기계 학습 문제를 해결하기 위해 잘 문서화되어 있습니까? 작은 데이터 세트 (수천 개의 예제)에서 프로토 타입을 제작하려고하므로 속도는 중요하지 않습니다. 편집 : 추천 엔진을 개발 중입니다. 따라서 정규 선형 회귀, 신경망, SVN 또는 공동 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.