통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
주성분 분석을 사용하여 회귀 변수를 선택하는 방법은 무엇입니까?
현재 주성분 분석을 사용하여 모델링에 사용할 변수를 선택하고 있습니다. 현재 실험에서 A, B 및 C를 측정합니다. 정말로 알고 싶은 것은 : 시간과 노력을 절약하기 위해 더 적은 측정을하고 C 및 / 또는 B 기록을 중단 할 수 있습니까? 내 데이터의 분산의 60 %를 차지하는 첫 번째 주요 구성 요소에 3 …

1
조건부 동요 성 대 이분산성
에서 경제학 후미오 하야시에 의해, (Chpt 1) 무조건적인 동질성 : 오차항 E (εᵢ²)의 두 번째 모멘트는 관측치에서 일정합니다. 기능적 형태 E (εᵢ² | xi)는 관측에 걸쳐 일정합니다 조건부 동질성 : 관측치에서 오차 항 E (εᵢ²)의 두 번째 모멘트가 일정하다는 제한이 해제됩니다. 따라서 조건부 제 2 모멘트 E (εᵢ² | xi)는 …

2
Monte Carlo 시뮬레이션 추정의 정밀도 찾기
배경 나는 일련의 모델의 출력을 결합한 Monte Carlo 시뮬레이션을 설계하고 있으며 시뮬레이션을 통해 시뮬레이션 결과의 확률과 확률 추정의 정확성에 대한 합리적인 주장을 할 수 있기를 바랍니다. 시뮬레이션은 특정 커뮤니티에서 배심원이 특정 피고에게 유죄 판결을받을 가능성을 발견 할 것입니다. 시뮬레이션 단계는 다음과 같습니다. 기존 데이터를 사용하여 인구 통계 학적 예측 변수에 …

4
표준 편차가 0 일 가능성이있는 데이터 세트의 Pearson 상관 관계
가능한 표준 편차가 0 인 데이터 세트의 피어슨 상관 계수를 계산하는 데 문제가 있습니다 (즉, 모든 데이터의 값이 동일 함). 다음 두 데이터 세트가 있다고 가정하십시오. float x[] = {2, 2, 2, 3, 2}; float y[] = {2, 2, 2, 2, 2}; 상관 계수 "r"은 다음 방정식을 사용하여 계산됩니다. float …

3
통계 소프트웨어 사용에서 수학 방정식 이해로의 전환?
문맥: 저는 심리학 박사 과정 학생입니다. 많은 심리학 박사 과정 학생들과 마찬가지로 저는 통계 소프트웨어를 사용하여 PCA, 분류 트리 및 군집 분석과 같은 기술까지 다양한 통계 분석을 수행하는 방법을 알고 있습니다. 그러나 분석을 한 이유와 지표의 의미를 설명 할 수는 있지만 기술이 어떻게 작동하는지 설명 할 수 없기 때문에 실제로 …

2
중첩되지 않은 두 모델의 AIC 차이 테스트
AIC 또는 다른 정보 기준의 요점은 덜 낫다는 것입니다. 따라서 두 가지 M1 모델이 있습니다 : y = a0 + XA + e 및 M2 : y = b0 + ZB + u, 첫 번째 (A1)의 AIC가 두 번째 (A2)의 AIC보다 작 으면 M1은 정보 이론 관점에서 더 잘 맞습니다. …
12 regression  aic 


3
3 단계 비상 대응표를 처리하는 적절한 방법
나는 여러 종에 대한 수 데이터, 그들이 수집 한 숙주 식물 및 비오는 날에 그 수집이 일어 났는지 여부와 함께 3 단계 우발 사태 표를 가지고 있습니다 (실제로 중요합니다!). R을 사용하면 가짜 데이터는 다음과 같습니다. count <- rpois(8, 10) species <- rep(c("a", "b"), 4) host <- rep(c("c","c", "d", "d"), 2) …

2
exp (X) ~ Gamma 인 경우 X를 빠르게 샘플링하는 방법?
내부 루프가 다음과 같은 간단한 샘플링 문제가 있습니다. v = sample_gamma(k, a) 여기서 sample_gamma감마 분포의 샘플은 Dirichlet 샘플을 형성합니다. 잘 작동하지만 일부 k / a 값의 경우 일부 다운 스트림 계산 언더 플로가 있습니다. 로그 공간 변수를 사용하도록 조정했습니다. v = log(sample_gamma(k, a)) 나머지 모든 프로그램을 조정 한 후에는 올바르게 …

1
누적 데이터 반복 테스트시 전체 유형 I 오류
그룹 순차적 방법 에 대한 질문이 있습니다 . Wikipedia에 따르면 : 두 치료군을 대상으로 한 무작위 시험에서 고전적 그룹 순차 검사는 다음과 같은 방식으로 사용됩니다. 각 그룹에 n 명의 피험자가있는 경우 2n 피험자에 대한 중간 분석이 수행됩니다. 두 그룹을 비교하기 위해 통계 분석이 수행되며, 대체 가설이 수용되면 시행이 종료됩니다. 그렇지 …

2
좋은 하이브리드 / 해밀턴 몬테 카를로 알고리즘을 설계 할 때 알아야 할 사항은 무엇입니까?
PyMC 용 하이브리드 몬테 카를로 샘플링 알고리즘을 설계 중이며 가능한 한 일반적인 무료로 만들기 위해 노력하고 있으므로 HMC 알고리즘 설계에 대한 조언을 찾고 있습니다. Radford의 설문 조사 장 과 Beskos 등 을 읽었습니다 . al.의 최근 HMC의 최적 (스텝 크기) 조정에 관한 논문 은 다음과 같은 팁을 모았습니다. 모멘텀 변수는 …

2
모델 선택 또는 정규화 후 GLM
이 질문을 두 부분으로 나누고 싶습니다. 둘 다 일반 선형 모델을 다루지 만, 첫 번째는 모델 선택을 다루고 다른 하나는 정규화를 다룹니다. 배경 : 나는 예측과 설명을 위해 GLM (선형, 로지스틱, 감마 회귀) 모델을 사용합니다. " 회귀로하는 정상적인 일 "을 언급 할 때, 나는 주로 (i) 계수에 대한 신뢰 구간, …


1
온라인으로 확장 가능한 통계 방법
이것은 효율적인 온라인 선형 회귀 에서 영감을 얻었으며 매우 흥미 롭습니다. 대규모 통계 컴퓨팅에 전념하는 텍스트 나 리소스가 있습니까? 이로 인해 주 메모리에 맞지 않는 데이터 세트를 사용하여 컴퓨팅하거나 효과적으로 서브 샘플링하기에는 너무 다양합니다. 예를 들어 온라인 방식으로 혼합 효과 모델을 적용 할 수 있습니까? MLE에 대한 표준 2 차 …

5
최고의 거리 측정
문맥 비교할 두 데이터 세트가 있습니다. 두 세트의 각 데이터 요소는 22 개의 각도를 포함하는 벡터입니다 (모두 와 사이 ). 각도는 주어진 휴먼 포즈 구성과 관련이 있으므로 포즈는 22 개의 관절 각도로 정의됩니다.π−π−π-\piππ\pi 내가 궁극적으로하려는 것은 두 데이터 세트의 "친밀 성"을 결정하는 것입니다. 따라서 한 세트의 각 포즈 (22D 벡터)에 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.