통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
"간단한"측정 오류 모델을 맞추는 방법
"OLS"측정 오류 모델을 추정하는 데 사용할 수있는 방법을 찾고 있습니다. x i = X i + e x , i Y i = α + β X iyi=Yi+ey,iyi=Yi+ey,iy_{i}=Y_{i}+e_{y,i} xi=Xi+ex,ixi=Xi+ex,ix_{i}=X_{i}+e_{x,i} Yi=α+βXiYi=α+βXiY_{i}=\alpha + \beta X_{i} 오류가 미지로 통상 무관 어디 편차를 및 σ 2 X . 이 경우 "표준"OLS가 작동하지 않습니다.σ2yσy2\sigma_{y}^{2}σ2xσx2\sigma_{x}^{2} Wikipedia …

4
자르지 않은 음수 이항 GEE 용 R / Stata 패키지?
이것은 나의 첫 번째 게시물입니다. 이 커뮤니티에 진심으로 감사드립니다. 0으로 잘린 종단 반응 (응답 변수 = 0이 될 확률)과 평균! = 분산을 분석하려고하므로 포아송보다 음의 이항 분포가 선택되었습니다. 내가 배제한 기능 / 명령 : 아르 자형 R의 gee () 함수는 제로 잘림이나 음의 이항 분포를 고려하지 않습니다 (MASS 패키지가로드 된 …


2
클러스터링 결과 비교 이해
데이터를 그룹으로 분류하는 실험을하고 있습니다. 나는이 주제를 처음 접했고 일부 분석 결과를 이해하려고 노력했다. Quick-R의 예제를 사용하여 여러 R패키지가 제안됩니다. 이 패키지 중 두 가지 ( 함수 및 )를 fpc사용해 보았습니다 . 내가 이해하지 못하는이 분석의 한 측면은 결과를 비교하는 것입니다.kmeansmclust # comparing 2 cluster solutions library(fpc) cluster.stats(d, fit1$cluster, fit2$cluster) …
13 r  clustering 

3
LASSO 솔루션 컴퓨팅을위한 GLMNET 또는 LARS?
LASSO 문제에 대한 계수를 얻고 싶습니다 || 와이− Xβ| | +λ | |β||1.||Y−Xβ||+λ||β||1.||Y-X\beta||+\lambda ||\beta||_1. 문제는 glmnet과 lars 함수가 다른 답변을 제공한다는 것입니다. glmnet 함수의 경우 대신에 여전히 다른 답변을 얻습니다.λλ / | |와이| |λ/||Y||\lambda/||Y||λλ\lambda 이것이 예상됩니까? lars 와 glmnet 의 관계는 무엇입니까 ? glmnet이 LASSO 문제에 더 빠르다는 것을 알고 …

2
시공간 예측 오차의 탐색 적 분석
데이터 : 저는 최근 풍력 생산 예측 오류의 시공간 분야의 확률 적 특성을 분석하기 위해 노력했습니다. 공식적으로 이것은 은 시간에 두 번 ( 및 ), 한 번에 공간 ( )에 색인을 생성 하고 는 미리보기 횟수입니다 (주변과 동일) , 정기적으로 샘플링 됨), 는 "예측 시간"의 수 (즉, 예측이 발행 된 …

7
통계 이론 및 응용 프로그램에서 이해하기
저는 최근 공학 및 수학을 배경으로 의학 및 생물학 모델링 석사 학위를 취득했습니다. 교육 프로그램에 상당히 많은 수의 수학 통계 (아래 목록 참조) 과정이 포함되어 있었지만 통계와 이론의 적용에 대해 완전히 잃어버린 경우가 종종 있습니다. "순수한"수학과 비교할 때 통계는 실제로 의미가 없습니다. 특히 대부분의 통계 학자 (내 과거 강사를 포함)가 …

5
Elo 등급 또는 페이지 순위가 내 세트에 의미가 있음을 증명하는 방법은 무엇입니까?
선수 세트가 있습니다. 그들은 서로에 대해 (쌍으로) 연주합니다. 한 쌍의 플레이어가 무작위로 선택됩니다. 어떤 게임에서든 한 플레이어가 이기고 다른 플레이어가집니다. 플레이어는 서로 제한된 수의 게임을합니다 (일부 플레이어는 더 많은 게임을, 더 적은 게임을). 그래서 나는 데이터를 가지고 있습니다 (누가 누구와 몇 번이나 이겼는지). 이제는 모든 플레이어가 이길 확률을 결정하는 순위가 …

1
우도 비율과 베이지안 모델 비교는 귀무 가설 검정에 대한 우수하고 충분한 대안을 제공합니까?
과학에 대한 귀무 가설 검정 (NHT)의 유용성을 누적 노력으로 비난하는 통계 학자와 연구원의 증가에 대응하여, 통계적 추론에 관한 미국 심리학 협회 태스크 포스는 NHT에 대한 명백한 금지를 피했지만 대신 연구원들에게 제안했다. NHT에서 파생 된 p- 값 외에 효과 크기를보고합니다. 그러나 효과 크기는 여러 연구에서 쉽게 축적되지 않습니다. 메타 분석 접근법은 …

5
단계적 로지스틱 회귀 및 샘플링
SPSS의 데이터 집합에 대해 단계별 로지스틱 회귀 분석을 적용하고 있습니다. 이 절차에서는 모델을 대략 임의의 하위 집합에 맞 춥니 다. 전체 표본의 60 %, 약 330 건입니다. 내가 흥미로운 점은 데이터를 다시 샘플링 할 때마다 최종 모델에서 다른 변수가 나타나고 나오는 것입니다. 최종 모형에는 항상 소수의 예측 변수가 있지만 표본에 …

1
올가미에 대한 LARS 대 좌표 하강
L1 정규 선형 회귀 피팅에 LARS [1] 사용과 좌표 하강 사용의 장단점은 무엇입니까? 나는 주로 퍼포먼스 측면에 관심이있다 (내 문제는 N수십만에서 p20 이하인 경향이있다 ). 그러나 다른 통찰력도 인정 될 것이다. 편집 : 내가 질문을 게시 한 후 chl은 Friedman 등의 논문 [2]에 좌표 하강이 다른 방법보다 상당히 빠른 것으로 …

1
R에서 lm 객체가없는 Newey-West 표준 오차 계산
어제 StackOverflow 에서이 질문을 하고 답변을 얻었지만 약간 해킹 된 것으로 보이며 더 나은 방법이 있다는 데 동의했습니다. 질문 : 벡터 (이 경우 주식 반환 벡터)에 대한 HAC (Newey-West) 표준 오류를 계산하고 싶습니다. 함수 NeweyWest()의 sandwich패키지는이 작업을 수행하지만, 필요 lm입력으로 개체. Joris Meys가 제공 한 솔루션은 벡터를 1로 투영하여 벡터를 …

2
학습 통계, 연습을위한 온라인 리소스 (솔루션 포함)?
저는 현재 대학교에서 초급 통계 과정 (의대 학생을위한)에서 조교로 일하고 있습니다. 오프라인에서는 교사를 돕는 정보가 담긴 책이 많이 있습니다. 그러나 내가 알고 싶은 것은 온라인에서 사용할 수있는 통계로 연습 (솔루션 포함)을 제공 하는 (좋은) 자원으로 안내 할 수 있는지 여부입니다 . (예 : 교사의 메모). 주제 자료는 기술 통계, 확률 …

1
중앙값 중앙값 계산
나는 많은 부동산 신고를하고 중간 가격은 종종 NAR (National Association of Realtors)에 의해 종종보고됩니다. 내가 알 수있는 한, 그들은 각 지역에서 부동산 가격의 중간 값 만 가져옵니다. 내 질문은 데이터 제한이 주어지면 국가 평균을 어떻게 계산해야합니까? 평균의 중간 값, 단순한 평균의 중간 값, 또는 가중 평균의 중간 값 또는 완전히 …
13 median 

4
두 표본 분포의 꼬리 비교
대략 0을 중심으로하는 두 개의 데이터 세트가 있지만 꼬리가 다른 것으로 의심됩니다. 분포를 정규 분포와 비교하기위한 몇 가지 테스트를 알고 있지만 두 분포를 직접 비교하고 싶습니다. 두 분포의 꼬리의 비만을 비교 하는 간단한 테스트가 있습니까? 감사합니다 fRed

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.