통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
반응 변수가 연간 이벤트 (일반적으로)가 발생하는 연도의 회귀 모델
이 특별한 경우에 나는 호수가 얼어 붙은 날을 언급하고 있습니다. 이 "아이스 온"날짜는 1 년에 한 번만 발생하지만 때로는 겨울이 따뜻한 경우 전혀 발생하지 않습니다. 따라서 1 년에 호수는 20 일 (1 월 20 일)에 얼어 붙을 수 있고, 다른 해에는 전혀 얼지 않을 수 있습니다. 목표는 시작 날짜의 동인을 …

2
n 번의 토스에서 k 개의 헤드를 관찰합니다. 동전은 공정합니까?
인터뷰에서 으로이 질문을 받았습니다 . "올바른"답변이 있습니까?( n , k ) = ( 400 , 220 )(n,k)=(400,220)(n, k) = (400, 220) 토스가 iid이고 헤드 확률이 가정합니다 . 400 토스에서 헤드 수의 분포는 보통 (200, 10 ^ 2)에 가까워 야 220 헤드가 평균에서 2 표준 편차 떨어져 있습니다. 이러한 결과를 관찰 …


2
KMEANS에서 k의 수를 추정하기 위해 BIC 사용
현재 장난감 데이터 세트 (ofc iris (:))의 BIC를 계산하려고합니다. 여기에 표시된 결과를 재현하려고합니다 (그림 5).이 논문은 BIC 공식의 소스이기도합니다. 나는 이것에 2 가지 문제가있다 : 표기법: ninin_i = 클러스터 의 요소 수iii CiCiC_i = 군집 중심 좌표iii xjxjx_j = 클러스터 할당 된 데이터 포인트iii mmm = 클러스터 수 1) 식에서 …

1
Firth Logistic Regression의 이론적 이해 추구
Firth 로지스틱 회귀 분석 (로지스틱 회귀 분석에서 완전 / 완전 또는 준-완전 분리를 처리하는 방법)을 이해하려고하므로 다른 사람들에게 단순화 된 용어로 설명 할 수 있습니다. 누구든지 Firth 추정이 MLE에 어떤 수정을했는지에 대한 간단한 설명이 있습니까? 나는 최선을 다해 Firth (1993)를 읽었으며 점수 함수에 수정이 적용되고 있음을 이해합니다. 나는 교정의 기원과 …

1
상호 정보를 사용하여 연속 변수와 범주 변수 간의 상관 관계 추정
제목에 관해서는 연속 변수와 범주 변수 사이의 "상관 관계"( "B를 알고있을 때 A에 대해 얼마나 많이 알고 있는지"로 정의)를 추정하기 위해 MI 이후에 MI 이후에 상호 정보를 사용하는 것이 좋습니다. 잠시 후에이 문제에 대한 의견을 말씀 드리지만 , 유용한 정보가 포함 된 CrossValidated에 대한이 다른 질문 / 답변 을 읽어 …

1
LLE (local linear embedding) 알고리즘의 단계를 설명 하시겠습니까?
LLE 알고리즘의 기본 원리는 세 단계로 구성되어 있습니다. k-nn과 같은 메트릭으로 각 데이터 포인트의 주변을 찾습니다. 이웃이 데이터 포인트에 미치는 영향을 나타내는 각 이웃에 대한 가중치를 찾으십시오. 계산 된 가중치를 기반으로 데이터의 저 차원 임베딩을 구성하십시오. 그러나 2 단계와 3 단계에 대한 수학적 설명은 내가 읽은 모든 교과서와 온라인 자료에서 …

4
방향성 비순환 그래프의 모서리가 인과 관계를 나타 냅니까?
자율 학습을위한 책인 확률 그래픽 모델을 공부하고 있습니다. DAG (directed acyclic graph)의 모서리가 인과 관계를 나타 냅니까? 베이지안 네트워크를 만들고 싶지만 화살표의 방향에 대해 잘 모르겠 으면 어떻게해야합니까? 모든 데이터는 상호 연관성이 아니라 관찰 된 상관 관계라는 것을 말해 줄 것입니다. 다음 장에서 이러한 문제를 다룰 것이라고 확신하기 때문에 너무 …

3
그래프 서식 지정 : 선 그래프에서 채우기를 사용하는 것이 언제 적절한가요?
이것은 데이터 시각화 질문입니다. 여기서 물어 보는 것이 좋습니다. 아래 그래프와 같이 시계열에 대해 선 그래프 아래에서 채우기를 사용하는 것이 언제 적절한가요? (하루에 핑 시간을 보이고 있음) 아래에 채우기가없는 일반 선을 사용하는 것이 더 일반적이지만 시각적 다양성을 위해 채우기를 사용하는 것이 좋습니까? 주제에 대한 지각 적 연구 나 스타일 가이드에 …

5
결 측값에 대한 다중 대치
특정 제약 조건에서 데이터 세트의 누락 된 값을 대체하기 위해 대치를 사용하고 싶습니다. 예를 들어, 내가 귀속 변수를 싶습니다 x1크거나 내 다른 두 변수의 합과 같다,라고 x2하고 x3. 또한 나 x3중 하나에 의해 대치되고 싶 거나 나 중 하나에 의해 대치되고 싶습니다 .0>= 14x20>= 16 다중 대치에 대해 SPSS에서 이러한 …

1
로그 연결 감마 GLM 대 로그 연결 가우시안 GLM 대 로그 변환 LM
내 결과에 따르면 GLM 감마가 대부분의 가정을 충족하는 것으로 보이지만 로그 변환 된 LM보다 가치있는 개선입니까? 내가 찾은 대부분의 문헌은 포아송 또는 이항 GLM과 관련이 있습니다. 나는 RANDOMIZATION을 사용한 일반 선형 모델 가정 평가의 기사가 매우 유용하다는 것을 알았지 만 결정을 내리는 데 사용 된 실제 도표는 부족하다. 다행히도 경험이있는 …

4
선형 모델과 비선형 모델의 구별
선형 대 비선형 모델의 속성에 대한 설명을 읽었지만 여전히 사용중인 모델이 선형인지 비선형인지 확실하지 않습니다. 예를 들어, 다음 모델은 선형 또는 비선형입니까? 와이티= β0+ β1B ( L ; θ ) X티+ ε티yt=β0+β1B(L;θ)Xt+εty_t=\beta_0 + \beta_1B(L;\theta)X_t+\varepsilon_t 와: B ( L ; θ ) = ∑k = 1케이b ( k ; θ ) …

1
Fisher 정보 매트릭스의 존재 조건
다른 교과서는 피셔 정보 매트릭스의 존재에 대한 다른 조건을 인용합니다. 이러한 여러 조건이 아래에 나열되어 있으며 각 조건은 "피셔 정보 매트릭스"의 정의 중 일부에 표시됩니다. 표준적인 최소 조건 세트가 있습니까? 아래 5 가지 조건 중 어느 것을 제거 할 수 있습니까? 조건 중 하나를 제거 할 수 있다면 왜 처음에 …

4
비선형 최소 제곱 법에 대한 초기 값을 선택하는 방법
위의 질문은 모든 것을 말합니다. 기본적으로 내 질문은 내가 추정하려고하는 매개 변수에서 비선형 적 인 일반적인 피팅 함수 (임의로 복잡 할 수 있음)에 대한 것입니다. 맞춤을 초기화하기 위해 초기 값을 어떻게 선택합니까? 비선형 최소 제곱을하려고합니다. 전략이나 방법이 있습니까? 이것이 연구 되었습니까? 어떤 참조? 임시 추측 외에 다른 것? 특히, 내가 …

1
pymc를 이용한 베이지안 네트워크 추론 (초보자의 혼란)
현재 Coursera에서 Daphne Koller의 PGM 과정을 수강하고 있습니다. 여기에서 우리는 일반적으로 베이지안 네트워크를 관측 된 데이터의 일부인 변수의 원인 및 결과 지향 그래프로 모델링합니다. 그러나 PyMC 자습서 및 예제에서 나는 일반적으로 PGM과 같은 방식으로 모델링되지 않았거나 혼란 스럽습니다. PyMC에서 관측 된 실제 변수의 부모는 종종 변수를 모델링하는 데 사용하는 분포의 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.