통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
베이지안 모델 평균화 (BMA)의 장점을 보여주는 간단한 예
나는 나의 연구에 베이지안 모델 평균화 (BMA) 접근법을 통합하고 있으며 곧 내 동료들에게 나의 작업에 대한 프리젠 테이션을 줄 것이다. 그러나 BMA는 실제로 내 분야에서 잘 알려져 있지 않으므로 모든 이론을 제시하고 실제로 내 문제에 적용하기 전에 BMA가 작동하는 이유에 대한 간단하지만 유익한 예를 제시하고자합니다. 두 가지 모델 중 하나를 …



2
여러 예측 변수로 로지스틱 회귀 모델 해석
Y특정 진입 기간 동안 요양원에서 종속 변수 가 사망 한 다변량 로지스틱 회귀 분석을 수행 하고 다음과 같은 결과를 얻었습니다 (변수가 시작하면 변수 는 범주 A값이지만 B범주 가 시작하는 변수 는 범주 형입니다). Call: glm(Y ~ A1 + B2 + B3 + B4 + B5 + A6 + A7 + …
12 r  regression  logistic 

1
삼각형 분포에 대한 MLE?
삼각형 분포에 일반적인 MLE 절차를 적용 할 수 있습니까? -노력하고 있지만 분포가 정의되는 방식으로 수학에서 한 단계 또는 다른 단계에서 차단 된 것 같습니다. c 위와 아래의 샘플 수를 알고 있다는 사실을 사용하려고합니다 (c를 모르고) :이 두 숫자는 cn이고 (1-c) n입니다 .n이 총 샘플 수인 경우. 그러나 그것은 파생에 도움이되지 …

1
glm () 함수의 "시작 값"은 무엇입니까?
매개 변수가 무엇입니까 start, etastart, mustart에서 GLM () 함수는 ? 나는 문서와 인터넷을 살펴 보았지만 이것이 무엇을 의미하는지 명확한 설명을 찾지 못했습니다. 그것은 체인에 대한 베이지안 "초기 값"과 비슷하지만 R의 glm () 함수가 빈번한 통계이기 때문에 이것이 관련이 있는지 의심 스럽습니다 ...

3
선형 회귀 분석에서 오차의 분산 공분산 행렬
통계 분석 패키지에 의해 실제로 var / cov 에러 매트릭스는 어떻게 계산됩니까? 이 아이디어는 이론상 분명하다. 그러나 실제로는 아닙니다. I는 확률 변수의 벡터가있는 경우 I는 평균 X =( X1, X2, … , X엔)⊤엑스=(엑스1,엑스2,…,엑스엔)⊤\textbf{X}=(X_{1}, X_{2}, \ldots, X_{n})^\top , 본인은 분산 / 공분산 행렬 일탈로부터 -의 외부 제품 설명한다 -평균 벡터 : …

2
PyMC 초보자 : 실제로 적합 모델에서 샘플링하는 방법
나는 매우 간단한 모델을 시도하고 있습니다. 정밀도를 알고 있다고 가정하는 법선을 피팅하고 평균을 찾고 싶습니다. 아래 코드는 Normal에 올바르게 맞는 것 같습니다. 그러나 피팅 후 모델에서 샘플링하고 싶습니다. 예를 들어 data변수 와 유사한 새 데이터를 생성 합니다. trace("mean")평균 변수에 대한 샘플을 얻는 데 사용할 수 있다는 것을 알고 있습니다 . …
12 mcmc  pymc 

1
속성이 공칭 일 때 개인을위한 최적의 거리 기능은 무엇입니까?
명목 형 (정렬되지 않은 범주 형) 속성의 경우 개인간에 어떤 거리 기능을 사용해야하는지 모르겠습니다. 나는 교과서를 읽고 있었고 Simple Matching 기능 을 제안 했지만 일부 책은 공칭을 이진 속성으로 변경하고 Jaccard Coefficient 를 사용해야한다고 제안합니다 . 그러나 명목 속성의 값이 2가 아닌 경우 어떻게해야합니까? 해당 속성에 3-4 개의 값이 있으면 …

2
변수 벡터가 어떻게 초평면을 나타낼 수 있습니까?
통계 학습의 요소를 읽고 12 페이지 (섹션 2.3)에서 선형 모델은 다음과 같이 표기됩니다. Yˆ=XTβˆY^=XTβ^\widehat{Y} = X^{T} \widehat{\beta} ... 여기서 는 예측 변수 / 독립 변수 / 입력의 열 벡터의 전치입니다. (이전에는 "모든 벡터가 열 벡터로 가정된다"고 말 했으므로 를 행 벡터로 만들고 를 열 벡터로 만들지 않겠습니까?) X T βXTXTX^{T}XTXTX^{T}βˆβ^\widehat{\beta} …

1
표본 공분산 행렬이 되돌릴 수없는 경우 어떻게해야합니까?
주어진 d- 차원 벡터 클러스터에 대해 다변량 정규 분포를 가정하고 샘플 d- 차원 평균 벡터와 샘플 공분산 행렬을 계산하는 몇 가지 클러스터링 기술을 연구하고 있습니다. 그런 다음 보이지 않는 새로운 d- 차원 벡터가이 클러스터에 속하는지 결정하려고 할 때이 측정을 통해 거리를 확인합니다. ( X나는− μ^엑스)'σ^− 1엑스( X나는− μ^엑스) > B0.95( …

1
다차원 점 사이의 분산을 찾는 방법은 무엇입니까?
p에 의해 n 인 p, 즉 n 개의 관측치가있는 행렬 X가 있다고 가정합니다. 각 관측치가 p 차원 공간에 있습니다. 이 n 개의 관측치의 분산을 어떻게 찾을 수 있습니까? p = 1 인 경우 정규 분산 공식을 사용해야합니다. p> 1 인 경우는 어떻습니까?
12 variance 

3
보고 할 유효 자릿수
대학의 첫 학년과 같이 상당히 표준적인 상황에서 평균 또는 신뢰 구간에 대해보고 할 유효 자릿수를 결정하는 더 과학적인 방법이 있습니까? 테이블에 넣을 유효 숫자 수를 보았습니다 . 왜 유효 자릿수 와 유효 숫자를 카이 제곱 적합 에 사용하지 않습니까? 수업 시간에 학생들에게 결과에서 표준 오류가 발생했을 때 15 자리의 유효 …

4
로그 선형 모형
누군가 왜 우리가 평신도 용어로 로그 선형 모델을 사용하는지 설명해 주시겠습니까? 나는 엔지니어링 배경에서 왔으며, 이것은 실제로 통계적으로 나에게 어려운 주제로 판명되었습니다. 답변 해 주셔서 감사합니다.

1
통계 모형에 적합하고 예측 된 값 찾기
다음 데이터가 있고 회귀 모델을 실행한다고 가정 해 봅시다. df=data.frame(income=c(5,3,47,8,6,5), won=c(0,0,1,1,1,0), age=c(18,18,23,50,19,39), home=c(0,0,1,0,0,1)) 한편으로는 소득을 예측하기 위해 선형 모델을 실행합니다. md1 = lm(income ~ age + home + home, data=df) 둘째, 원 변수를 예측하기 위해 로짓 모델을 실행합니다. md2 = glm(factor(won) ~ age + home, data=df, family=binomial(link="logit")) 두 모델 모두 …
12 r 

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.