통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
히스토그램에서 평균을 나타내는 것이 적절합니까?
평균값을 시각화하기 위해 히스토그램에 수직선을 추가하는 것이 "좋아"입니까? 나에게는 괜찮은 것 같지만 교과서와 같은 것에서는 이것을 본 적이 없으므로 그렇게하지 않는 어떤 종류의 협약이 있는지 궁금합니다. 그래프는 용어 용지에 대한 것이므로 실수로 중요하지 않은 통계 통계 규칙을 실수로 위반하지 않도록하고 싶습니다. :)

3
두 개의 독립적 감마 랜덤 변수의 합
감마 분포에 관한 Wikipedia 기사에 따르면 : 만약 및 , 여기서, 및 독립적 인 랜덤 변수는 다음 .Y ∼ G a m m a ( b , θ ) X Y X + Y ∼ G a m m a ( a + b , θ )X∼Gamma(a,θ)X∼Gamma(a,θ)X\sim\mathrm{Gamma}(a,\theta)Y∼Gamma(b,θ)Y∼Gamma(b,θ)Y\sim\mathrm{Gamma}(b,\theta)XXXYYYX+Y∼Gamma(a+b,θ)X+Y∼Gamma(a+b,θ)X+Y\sim \mathrm{Gamma}(a+b, \theta) 그러나 …

3
F 통계량, F- 임계 값 및 P- 값
저는이 분야를 처음 접했고 ANOVA 테이블의 결과를 기반으로 귀무 가설을 기각한다는 개념을 이해하기가 어렵습니다. 계산 된 F와 임계 값은 p- 값과 어떤 관련이 있습니까? 그리고 계산 된 F가 1보다 크면 p- 값이 알파보다 작더라도 항상 귀무 가설을 기각해야한다는 것을 나타 냅니까? 이 질문이 나의 무지의 징후 인 경우에 죄송하지만, 저는 …
13 anova 


2
자기 상관과의 관계는 무엇입니까?
이를 시작하기 위해 저는 수학적 배경이 매우 깊지 만 시계열이나 통계 모델링을 다루지 않았습니다. 그래서 당신은 나와 함께 매우 부드럽게하지 않아도됩니다 :) 상업용 건물에서 에너지 사용 모델링에 대한이 논문을 읽고 있으며 저자는 다음과 같이 주장합니다. [자기 상관의 존재]는 모델이 본질적으로 자기 상관 된 에너지 사용의 시계열 데이터로부터 개발 되었기 때문이다. …

2
랜덤 행렬의 경우 SVD가 전혀 설명하지 않아야합니까? 내가 도대체 ​​뭘 잘못하고있는 겁니까?
전적으로 임의의 데이터로 구성된 2 차원 행렬을 구성하면 PCA 및 SVD 구성 요소가 본질적으로 아무 것도 설명하지 않을 것입니다. 대신 첫 번째 SVD 열이 데이터의 75 %를 설명하는 것처럼 보입니다. 이것이 어떻게 가능할까요? 내가 도대체 ​​뭘 잘못하고있는 겁니까? 줄거리는 다음과 같습니다. R 코드는 다음과 같습니다. set.seed(1) rm(list=ls()) m <- matrix(runif(10000,min=0,max=25), …
13 r  pca  svd 

1
로지스틱 회귀 분석의 예측 이해
로지스틱 회귀 모델 (R의 glm)에서 내 예측은 예상 한대로 0과 1 사이로 제한되지 않습니다. 로지스틱 회귀 분석에 대한 나의 이해는 입력 및 모델 매개 변수가 선형으로 결합되고 로짓 링크 함수를 사용하여 반응이 확률로 변환된다는 것입니다. 로짓 함수는 0과 1 사이에 경계가 있기 때문에 예측이 0과 1 사이에 경계가있을 것으로 예상했습니다. …


2
자기 연구는 얼마나 멀리 갈 수 있습니까?
나는 공식 또는 구조화 된 데이터 분석 또는 머신 러닝 과정 (최근의 온라인 오퍼링 제외)에 참여한 적이 없으며 읽거나 시도하여 내가 아는 대부분의 것을 배웠습니다. 나는 직장을 구할 수 없다는 것을 알고 있습니다. 제 질문은 더 나은 것이 아니라 ( 이 질문과 같은 ) 오히려 직업을 신청할 수있는 수준에 도달 …

1
비율 분석 기법
비율과 비율 분석을 다루는 조언과 의견을 찾고 있습니다. 내가 비율을 분석하는 분야에서 특히 널리 퍼져 있지만 문제가 될 수 있다고 제안하는 몇 가지 논문을 읽었습니다. Kronmal, Richard A. 1993. 스퓨리어스 상관 관계와 비율 표준의 오류가 재검토되었습니다. 왕립 통계 학회지 시리즈 A 156 (3) : 379-392 및 관련 논문. 내가 지금까지 …

1
LDA의 대수. 변수 및 선형 판별 분석의 피셔 식별 능력
분명히, Fisher 분석은 클래스 간 분산을 최소화하면서 동시에 클래스 간 분리를 최대화하는 것을 목표로합니다. 변수의 판별력에 대한 유용한 측정 값은 대각선 양 됩니다.비나는 내가/ W나는 내가Bii/WiiB_{ii}/W_{ii} http://root.cern.ch/root/htmldoc/TMVA__MethodFisher.html p x p사이 ( B )와 클래스 내 ( W ) 행렬 의 크기 ( ) 는 입력 변수의 수에 의해 주어진다는 것을 …

2
Stata에서 프로 빗 모델을 어떻게 해석합니까?
Stata에서 실행 한이 probit 회귀를 해석하는 방법을 잘 모르겠습니다. 데이터는 대출 승인 상태이며 흰색은 더미 변수로, 사람이 백인이면 = 1이고 사람이 그렇지 않은 경우 = 0입니다. 이것을 읽는 방법에 대한 도움을 주시면 감사하겠습니다. 내가 주로 찾고있는 것은 백인과 비백 인 모두에 대한 대출 승인 가능성을 찾는 방법입니다. 누군가가 여기에있는 텍스트와 …

2
포아송 대 로지스틱 회귀
추적 관찰 기간이 다른 환자 집단이 있습니다. 지금까지 나는 시간 측면을 무시하고 이진 결과 질병 / 무병을 모델링해야합니다. 나는 일반적으로이 연구에서 로지스틱 회귀를 수행하지만, 내 다른 동료는 포아송 회귀가 적절한 지 물었다. 나는 그것을 포아송에 포함시키지 않았으며,이 설정에서 포아송을 수행 할 때의 이점과 단점이 로지스틱 회귀와 비교 될지 확실하지 않았다. …



당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.