통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
랜덤 포레스트 알고리즘 단계의 동기
나는 임의의 숲을 구성하는 잘 알고있어하는 방법은있는 그대로 다음과 같습니다 (에서 http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm ) 숲에서 나무를 만들려면 다음을 수행하십시오. N 크기의 샘플을 부트 스트랩합니다. 여기서 N은 트레이닝 세트의 크기입니다. 이 부트 스트랩 샘플을이 트리의 학습 세트로 사용하십시오. 트리의 각 노드에서 무작위로 M 피처의 m을 선택하십시오. 분할 할 m 기능 중 최상의 …

2
랜덤 효과 모델에서 효과가 입력 변수와 상관 관계가없는 이유는 무엇입니까?
에서 위키 백과 개별 특정 효과, 랜덤 효과 가정 및 고정 효과 가정에 대해 두 가지 일반적인 가정이 있습니다. 랜덤 효과 가정 (임의 효과 모델에서 만들어진)은 개별 특정 효과가 독립 변수와 상관 관계 가 없다는 것 입니다. 고정 효과 가정은 개별 특정 효과가 독립 변수와 상관 되어 있다는 것입니다. 랜덤 …

3
누적 / 누적 플롯 (또는 "로렌츠 곡선 시각화")
나는 그런 음모가 무엇인지 모르므 로이 질문에 바보 같은 제목을주었습니다. 다음과 같이 정렬 된 데이터 세트가 있다고 가정 해 봅시다. 4253 4262 4270 4383 4394 4476 4635 ... 각 숫자는 특정 사용자가 웹 사이트에 기여한 게시물의 양에 해당합니다. 여기에 정의 된 "참여 불평등"현상을 경험적으로 조사하고 있습니다 . 이해하기 쉽도록 독자가 …

2
왜 후방 밀도가 이전 밀도 시간 우도 함수에 비례합니까?
베이 즈 정리에 따르면 입니다. 그러나 내 계량 텍스트에 따르면 라고 말합니다 . 왜 이런가요? 가 무시되는 이유를 모르겠습니다 .P ( θ | Y ) α P ( Y | θ ) P ( θ ) P ( Y )P(y|θ)P(θ)=P(θ|y)P(y)P(y|θ)P(θ)=P(θ|y)P(y)P(y|\theta)P(\theta) = P(\theta|y)P(y)P(θ|y)∝P(y|θ)P(θ)P(θ|y)∝P(y|θ)P(θ)P(\theta|y) \propto P(y|\theta)P(\theta)P(y)P(y)P(y)

3
정규 방정식 증명에 관한 질문
정규 방정식 : 에 X가 가역적이라는 가정없이 하나 이상의 솔루션 이 있음을 어떻게 증명할 수 있습니까?(XTX)β=XTY(XTX)β=XTY(X^TX)\beta = X^TY 내 유일한 추측은 그것이 일반화 된 역수와 관련이 있지만 완전히 잃어 버린 것입니다.
11 regression  proof 

1
스플라인 / 부드러운 회귀로 새 데이터를 예측하는 방법
예측 모델에 스무딩 / 스플라인을 사용할 때 새 데이터에 대한 예측을 수행하는 방법에 대한 개념적인 설명을 누구나 도울 수 있습니까? 예를 들어, 사용하여 작성된 모델 특정 gamboost에서 mboostP 스플라인과, R의 패키지, 어떻게 새로운 데이터 예측을 만들어? 훈련 데이터에서 무엇을 사용합니까? 독립 변수 x의 새로운 값이 있고 y를 예측하고 싶다고 가정하십시오. …

2
인형 피셔?
짧은 버전 : 통계에 대한 배경 지식이 거의 없거나 전혀없는 사람들을 대상으로하는 통계에 대한 Ronald Fisher의 저술 (논문 및 서적)에 대한 소개가 있습니까? 저는 비 통계학자를 겨냥한 "주석 피셔 독자"와 같은 것을 생각하고 있습니다. 나는 아래 에서이 질문에 대한 동기 부여를 언급했지만 그것이 오래 걸리는 것 (더 간결하게 설명하는 방법을 …

4
측정 불확실성을 포함하는 통계 테스트
y1과 y2라고하는 두 가지 질량 측정 그룹 (mg 단위)이 있다고 가정합니다. 두 가지 표본이 다른 평균을 가진 모집단에서 추출되었는지 확인하기 위해 테스트를하고 싶습니다. 예를 들어 (R에서) 이와 같은 것 : y1 <- c(10.5,2.9,2.0,4.4,2.8,5.9,4.2,2.7,4.7,6.6) y2 <- c(3.8,4.3,2.8,5.0,9.3,6.0,7.6,3.8,6.8,7.9) t.test(y1,y2) p- 값은 0.3234이며, 유의 수준 0.05에서는 두 그룹이 동일한 평균을 가진 모집단에서 도출되었다는 …

1
LASSO는 공선 예측 변수 중에서 어떻게 선택합니까?
GLM LASSO 모델이 상관 관계가 높은 그룹 중에서 특정 예측 변수를 선택하는 이유와 최상의 하위 집합 기능 선택과 다르게 예측하는 이유에 대한 직관적 인 답변을 찾고 있습니다. 1996 년 Tibshirani의 그림 2에 표시된 LASSO의 구조에서 LASSO 가 더 큰 분산을 갖는 예측 변수를 선택한다고 믿었습니다. 이제 로지스틱 회귀 모델에 대해 …

3
신용 점수에 관한 좋은 책 / 종이
신용 점수에 관한 책 추천을 찾고 있습니다. 이 문제의 모든 측면에 관심이 있지만 대부분 다음과 같습니다. 1) 좋은 기능. 그들을 구축하는 방법? 어느 것이 좋았습니까? 2) 신경망. 신용 점수 문제에 대한 그들의 신청. 3) 신경망을 선택했지만 다른 방법에도 관심이 있습니다.

1
두 공분산 행렬 결합
분포의 공분산을 병렬로 계산하고 분포 결과를 단일 가우시안으로 결합해야합니다. 두 가지를 어떻게 결합합니까? 두 작품이 비슷하게 분포되고 크기가 조정되면 두 작품 사이의 선형 보간. Wikipedia 는 조합에 대한 하단에 포럼을 제공하지만 옳지 않은 것 같습니다. 두 개의 동일하게 분포 된 분포는 동일한 공분산을 가져야하지만 페이지 하단의 공식은 공분산을 두 배로합니다. …



2
Cox PH 분석 및 공변량 선택에서 성향 스코어 가중치
사건 발생 시간 생존 데이터의 Cox 비례 위험 모델링을 수행 할 때 성향 스코어 가중치 (IPTW)와 관련하여 : 대부분의 경우 환자가 이미 기준선에서 복용하고있는 약물의 치료 효과를 살펴 보는 데 관심이있는 예상 레지스트리 데이터가 있습니다. 따라서 데이터를 가장 잘 분석하는 방법을 잘 모르겠습니다. 잠재적으로, 기준 변수 중 일부는 치료에 의해 …

1
비정상적으로 제한된 반응 변수의 회귀 처리
이론적으로 -225와 +225 사이에 묶인 응답 변수를 모델링하려고합니다. 변수는 게임을 할 때 피험자가 얻은 총 점수입니다. 이론적으로는 피험자들이 +225를 득점하는 것이 가능합니다. 그럼에도 불구하고 점수는 주체의 행동뿐만 아니라 다른 사람의 행동에 따라 달라졌 기 때문에 최대 득점 한 사람은 모두 최대 125 명이었습니다 (이것은 서로 점수를 매길 수있는 최고 2 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.