통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
중첩되지 않은 모델의 AIC : 정규화 상수
AIC는 . 여기서 는 최대 가능성 추정값이고 는 모수 공간의 차원입니다. 의 추정을 위해, 보통 밀도의 상수 인자를 무시합니다. 이것은 가능성을 단순화하기 위해 매개 변수에 의존하지 않는 요소입니다. 반면,이 요소는 중첩되지 않은 모델을 비교할 때이 요소가 일반적이지 않으며 해당 AIC의 순서가 고려되지 않으면 다를 수 있으므로 AIC 계산에 매우 중요합니다.AIC=−2log(L(θ^))+2pAIC=−2log⁡(L(θ^))+2pAIC=-2 …


2
랜덤 포레스트 : 변수가 중요하다는 것을 알고 있다면
임의의 포리스트가 무작위로 mtry 변수를 선택하여 각 의사 결정 트리를 작성한다는 것을 이해합니다. 따라서 mtry = ncol / 3 인 경우 각 변수는 평균적으로 나무의 1/3에서 사용됩니다. 그리고 나무의 2/3는 그것을 사용하지 않을 것입니다. 그러나 단일 변수가 매우 중요하다는 것을 알고 있다면 각 트리에서이 변수를 선택할 확률을 수동으로 높이는 것이 …

6
변동 계수 – IQR / 중앙 또는 대안과 같은 강력한 비모수 적 측정?
주어진 데이터 세트에 대해 스프레드는 종종 표준 편차 또는 IQR (사 분위수 범위)로 계산됩니다. a standard deviation는 정규화되고 (z- 점수 등) 두 개의 다른 모집단의 분포를 비교하는 데 사용할 수 있지만, 두 개의 다른 모집단의 표본은 두 개의 다른 척도에서 값을 가질 수 있기 때문에 IQR의 경우에는 해당되지 않습니다. e.g. …

2
유한 가우시안 혼합물과 가우시안 사이의 거리는 얼마입니까?
알려진 가중치, 평균 및 표준 편차를 가진 유한하게 많은 가우시안이 혼합되어 있다고 가정합니다. 평균이 같지 않습니다. 물론 모멘트는 성분 모멘트의 가중 평균이므로 혼합물의 평균 및 표준 편차를 계산할 수 있습니다. 혼합물은 정규 분포가 아니지만 정상으로부터 얼마나 멀리 떨어져 있습니까? 위의 이미지는 표준 편차 (구성 요소)와 동일한 평균 및 분산을 가진 …

3
Kolmogorov-Smirnov Test에 대한 다중 샘플 버전 또는 대안이 있습니까?
한 플롯이 처리를 받고 다른 플롯이 제어를받는 6 쌍의 플롯에서 나무의 크기 분포를 비교하고 있습니다. 각 쌍의 플롯에서 Kolmogorov-Smirnov 테스트를 사용하여 범위는 0.0003707 ~ 0.75 입니다. KS 테스트의 다중 샘플 확장과 같은 모든 반복 실험을 처리하는 적절한 방법이 있습니까? 아니면 적절한 후속 테스트가 있습니까? 또는 " 두 쌍의 플롯에서 크기 …

1
R에서 반복 측정 값이있는 선형 회귀
반복 측정 설계를 위해 R에서 선형 회귀를 수행하는 방법을 알 수 없었습니다. A의 이전 질문 (아직 답) 그것은 사용하지 않는 나에게 제안 된 lm혼합 모델을 사용하지 않고 있지만. 나는 lm다음과 같은 방식으로 사용 했다 : lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) (데이터 세트에 대한 자세한 내용은 위의 링크에서 찾을 수 있습니다) 그러나 …

2
비닝 된 데이터의 3 분위를 추정하는 방법은 무엇입니까?
모집단의 4 분의 1 이상을 포함하는 개방 구간에 속하는 경우 3 분위를 결정하는 기술적 트릭이 있습니까 (그래서 구간을 닫고 표준 공식을 사용할 수 없음)? 편집하다 내가 무언가를 잘못 이해했을 때 나는 다소 완전한 맥락을 제공 할 것이다. 두 개의 열과 6 개의 행이있는 테이블에 데이터가 정렬되어 있습니다. 각 열에는 간격 …


3
이상 감지를위한 결 측값이있는 시계열의 STL
관측치가 누락 된 일련의 기후 데이터에서 이상 값을 감지하려고합니다. 웹을 검색하면서 사용 가능한 많은 접근 방법을 찾았습니다. 이 중 stl 분해는 추세와 계절 성분을 제거하고 나머지를 연구한다는 의미에서 매력적입니다. 읽기 STL : 황토에 계절 - 트렌드 분해 절차 기반은 , stl누락 된 값에도 불구하고 적용 할 이상치의 영향을받지 가능한 가변성을 …


4
AIC (또는 BIC)를 사용한 PCA 모델 선택
AKA (Akaike Information Criterion)를 사용하여 PCA에서 추출 할 적절한 수의 요소를 선택하고 싶습니다. 유일한 문제는 매개 변수 수를 결정하는 방법을 잘 모르겠다는 것입니다. 행렬 고려하십시오. 여기서 은 변수 수를 나타내고 는 관측치 수를 나타냅니다. 예를 들어 입니다. 공분산 행렬이 대칭이므로 의 최대 우도 추정값은 AIC의 매개 변수 수를 동일하게 설정할 …

1
희소 데이터를 기반으로하는 공분산 행렬의 고유 및 svd 분해가 다른 결과를 생성하는 이유는 무엇입니까?
희소 / 갭피 데이터 세트를 기반으로 공분산 행렬을 분해하려고합니다. 로 계산 된 람다 (설명 된 분산)의 합이 svd점점 더 좁아지는 데이터로 증폭되고 있음을 알았습니다. 틈없이, svd그리고 eigen높을 동일한 결과. 이것은 eigen분해 로 발생하지 않는 것 같습니다 . svd람다 값이 항상 양수이기 때문에 사용에 기울고 있었지만이 경향은 걱정입니다. 적용해야 할 일종의 …
12 r  svd  eigenvalues 

2
randomForest는 분류 대신 회귀를 선택합니다
R 에서 randomForest 패키지를 사용하고 홍채 데이터를 사용하는 경우 생성 된 임의 포리스트는 분류이지만 약 700 개의 기능이있는 데이터 세트 (28x28 픽셀 이미지의 각 픽셀)를 사용하면 레이블 열의 이름이 지정됩니다 label, randomForest생성 된 회귀입니다. 다음 줄을 사용하고 있습니다. rf <- randomForest(label ~ ., data=train) 분류 대신 회귀 분석이 어떻게 사용됩니까? …
12 r  random-forest 

1
계층 적 베이지안 모델과 경험적 베이지안
HBM 대 EB가 하이퍼 파라미터가 샘플링 / 추정 / 기타 "게임 중"인 두 가지 대안이라고 생각하십니까? 이 둘 사이에는 분명히 관련이 있습니다. HBM을 EB보다 "완전히 베이지안"이라고 생각하십니까? "완전히 베이지안"과 다른 대안의 차이점이 무엇인지 알 수있는 곳이 있습니까? 감사.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.