통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
별도의 모델링 / 검증 세트를 사용하여 회귀 모델을 작성할 때 검증 데이터를 "재순환"하는 것이 적절합니까?
모델링 / 검증 관찰간에 80/20 분할이 있다고 가정합니다. 모델을 모델링 데이터 세트에 적합 시켰으며 유효성 검증 데이터 세트에서보고있는 오류에 익숙합니다. 향후 관측 값을 채점하기 위해 모델을 롤아웃하기 전에 유효성 검사를 모델링 데이터와 다시 결합하여 100 % 데이터에 대한 매개 변수 추정치를 업데이트하는 것이 적절합니까? 나는 이것에 대한 두 가지 관점을 …

3
다른 결과에 기초한 통계 테스트 선택 (예 : 정규성)
그래서 다른 결과를 바탕으로 한 통계 테스트를 선택하는 것은 좋지 않다고 들었습니다. 그래도 나에게는 이상해 보인다. 예를 들어, 다른 테스트에서 잔차가 정규 분포를 따르지 않는다고 제안 할 때 비모수 적 테스트를 사용하는 경우가 종종 있습니다. 이 접근법은 꽤 널리 받아 들여져 있지만이 단락의 첫 번째 문장에 동의하지 않는 것 같습니다. …

1
구조 방정식 : R lavaan 패키지에서 상호 작용 효과를 지정하는 방법
R lavaan 패키지 를 사용하여 구조 방정식 모델을 추정하고 있습니다. 모델이 1 개의 잠재 성 변수와 2 개의 명시 적 설명 변수가있는 1 개의 내인성 매니페스트 변수로 구성되어 있다고 가정합니다. group = {0,1} attitude1 = latent,scale age = respondent's age 원하는 용암 모델은 다음과 같습니다 (작동하지 않음). model <- ' …
13 r  interaction  sem  lavaan 

1
패널 데이터 모델의 그룹 내에서 표준화 된 종속 변수?
식별 그룹 내 종속 변수의 표준화가 의미가 있습니까? 다음 실무 논문 (법률 아마존에서 산림 파괴 둔화; 가격 또는 정책?, pdf )은 표준화 된 종속 변수를 사용하여 산림 파괴에 대한 브라질의 일반적인 정책 변경의 영향을 분석합니다. 표준화는 다음과 같이 수행됩니다. Ynewit=Yit−Yi¯¯¯¯¯sd(Yit)Yitnew=Yit−Yi¯sd(Yit) Y^{new}_{it} = \frac{Y_{it} - \overline{Y_i}}{sd(Y_{it})} 저자는 이것이 "시정촌 내의 삼림 …

4
패널 데이터와 일치하는 성향 점수
나는 개인의 종단 데이터 세트를 가지고 있으며 그들 중 일부는 치료를 받았으며 다른 사람들은 그렇지 않았습니다. 모든 개인은 출생부터 18 세까지의 표본에 있으며 치료는 그 범위 사이의 어떤 나이에 발생합니다. 치료 기간은 사례마다 다를 수 있습니다. 성향 점수 일치를 사용하여 출생 연도부터 18 세까지 각 쌍을 추적 할 수 있도록 …

2
랜덤 포레스트 모델을 사용할 때 변수를 기록 / 처리하는시기?
여러 속성을 기반으로 가격을 예측하기 위해 Random Forests를 사용하여 회귀를 수행하고 있습니다. 코드는 Scikit-learn을 사용하여 Python으로 작성됩니다. 회귀 모형에 맞도록 변수를 사용 하기 전에 exp/ log를 사용하여 변수를 변환해야하는지 어떻게 결정 합니까? Random Forest와 같은 Ensemble 방식을 사용할 때 필요합니까?

3
R에서 가변 최대 회전 주성분을 계산하는 방법은 무엇입니까?
25 개의 변수에서 PCA를 실행하고을 사용하여 상위 7 개의 PC를 선택했습니다 prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) 그런 다음 해당 구성 요소에서 varimax 회전을 수행했습니다. varimax7 <- varimax(prc$rotation[,1:7]) 이제 varimax는 PCA 회전 데이터를 (varimax 객체의 일부가 아니기 때문에-로딩 행렬과 회전 행렬 만) varimax 회전하고 싶습니다. 이 작업을 수행하려면 회전 …
13 r  pca  factor-rotation 

4
주간 평균을 보존하는 인플루엔자 데이터 보간
편집하다 필요한 절차를 정확하게 설명 하는 논문 을 찾았습니다 . 유일한 차이점은 종이가 월간 평균을 유지하면서 월간 평균 데이터를 매일 보간한다는 것입니다. 에 접근 방식을 구현하는 데 문제가 R있습니다. 모든 힌트를 부탁드립니다. 기발한 매주 다음과 같은 카운트 데이터가 있습니다 (주당 하나의 값). 의사의 상담 횟수 인플루엔자 사례 수 내 목표는 …

1
큰 샘플 점근선 / 이론-신경 써야하는 이유?
이 질문이 "너무 일반적인 것"으로 표시되지 않기를 바라며, 모든 혜택을 얻는 토론이 시작되기를 바랍니다. 통계에서 우리는 큰 표본 이론을 배우는 데 많은 시간을 소비합니다. 우리는 무증상 편향, 무증상 효율성, 점근 분포 등을 포함한 평가자의 점근 적 특성 평가에 깊은 관심을 가지고 있습니다. 점근선이라는 단어는 라는 가정과 밀접한 관련이 있습니다.n→∞n→∞n \rightarrow …

1
혼합 효과 모델에 대한 예측 : 임의 효과로 무엇을해야합니까?
이 가상의 데이터 세트를 고려해 봅시다 : set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) lme랜덤 효과 모델로 응답을 모델링하는 데 사용할 수 있습니다 . require(nlme) model …

1
동질성 가정을 위반하는 회귀 분석에서 부트 스트래핑 표준 오류와 신뢰 구간이 적절합니까?
표준 OLS 회귀 분석에서 두 가지 가정이 위반되는 경우 (정규 오차 분포, 균일 성), 표준 오차와 신뢰 구간의 부트 스트랩은 회귀 계수의 중요성과 관련하여 의미있는 결과를 얻기위한 적절한 대안입니까? 부트 스트랩 된 표준 오차와 신뢰 구간에 대한 유의성 검정이 이분산성으로 여전히 "작동"합니까? 그렇다면이 시나리오에서 사용할 수있는 해당 신뢰 구간 (백분위 …


3
R의 빅 데이터 클러스터링 및 샘플링과 관련이 있습니까?
데이터 과학을 처음 사용하고 R에서 200,000 개의 행과 50 개의 열이있는 데이터 세트에서 클러스터를 찾는 데 문제가 있습니다. 데이터에는 숫자 변수와 명목 변수가 모두 있으므로 유클리드 거리 측정을 사용하는 K- 평균과 같은 방법은 적절한 선택처럼 보이지 않습니다. 따라서 거리 매트릭스를 입력으로 받아들이는 PAM, agnes 및 hclust로 전환합니다. 데이지 방법은 혼합 …


3
피구 팀이 플레이어의 승리 기록을 바탕으로 이길 확률을 어떻게 예측할 수 있습니까?
세계에 80 명의 피구 선수가 있다고 상상해보십시오. 그들 각각은 다른 79 명의 플레이어와 무작위로 무작위로 수천 개의 피구 게임을했습니다. 이것은 팀이없는 세계입니다 (예를 들어, 모든 플레이어는 각 팀마다 게임 초안을받을 수 있습니다). 각 플레이어의 이전 승률을 알고 있습니다 (예 : 하나는 모든 이전 게임의 46 %를, 다른 하나는 그의 모든 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.