통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


4
시닥 또는 본 페로 니?
나는 SPSS에서 일반화 선형 모델을 사용하여 16 개의 다른 종의 식물에서 평균 애벌레 수 (비정규, Tweedie 분포 사용)의 차이를 살펴보고 있습니다. 여러 비교를 실행하고 싶지만 Sidak 또는 Bonferroni 수정 테스트를 사용해야하는지 잘 모르겠습니다. 두 테스트의 차이점은 무엇입니까? 하나는 다른 것보다 낫습니까?


5
lme4 또는 asreml-R에 해당하는 기타 오픈 소스 R 패키지 코드
lme4, nlme, baysian regression package 또는 사용 가능한 혼합 모델을 사용하고 싶습니다. Asreml-R 코딩 규칙의 혼합 모델 구체적인 내용으로 들어가기 전에 ASREML 코드에 익숙하지 않은 사람들을 위해 asreml-R 규칙에 대한 세부 정보를 원할 수 있습니다. y = Xτ + Zu + e ........................(1) ; y가 n × 1 관측 값 …
13 r 


1
정규 분포의 조합에서 나온 분위수
저는 연령대가 다른 어린이를위한 인체 치수의 분포 (어깨 폭과 같은)에 대한 정보를 가지고 있습니다. 각 연령과 치수에 대해 평균 표준 편차가 있습니다. (또한 8 개의 Quantile이 있지만 원하는 것을 얻을 수 없다고 생각합니다.) 각 차원마다 길이 분포의 특정 Quantile을 추정하고 싶습니다. 각 치수가 정규 분포를 따른다고 가정하면 평균 및 표준 …

2
다중 공선 성을 다루기
패키지 vif()방법 을 사용하여 car모델에서 입력의 다중 공선도를 계산할 수 있다는 것을 배웠습니다 . 에서 위키 피 디아 경우, vif값이보다 큰 경우 5우리는 입력이 다중 공선 성 문제를 앓고 있음을 고려할 수 있습니다. 예를 들어, lm()방법을 사용하여 선형 회귀 모델을 개발 vif()했으며 다음과 같이 제공합니다. 우리가 볼 수 있듯이, 입력 …

6
변수 간의 관계를 식별하기위한 R 패키지
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 3 년 전 . 변수 사이에 관계가 있는지 여부를 탐색하는 데 사용할 수있는 R 패키지가 있습니까? 일반적으로 패턴을 찾을 때 상관 관계를보고 패싯 플롯을 봅니다. 그런 다음 …

3
군집 확률 분포-방법 및 지표?
나는 각각 5 개의 벡터로 된 응집 된 이산 결과를 포함하고, 각각의 벡터의 결과는 다른 분포에 의해 생성 된 일부 데이터 포인트를 가지고 있습니다 (구체적으로는 확실하지 않습니다. 법칙 (대략 1 ~ 0). K-Means와 같은 클러스터링 알고리즘을 사용하여 5 가지 구성 요소 분포의 속성을 기반으로 각 데이터 포인트를 그룹으로 분류하려고합니다. 이러한 …

2
MCMC가 단일 값으로 수렴합니까?
jags와 rjags 패키지를 사용하여 계층 적 모델을 맞추려고합니다. 내 결과 변수는 y이며, 이는 베르누이 시험의 순서입니다. 저는 P와 M이라는 두 가지 범주로 수행되는 38 명의 인간 과목을 가지고 있습니다. 나의 분석에 따르면, 모든 화자는 P 범주에서 의 성공 확률과 M 범주에서 θ p × θ m 의 성공 확률 을가 …

1
연속 변수와 이진 변수의 혼합을 기반으로 한 PCA 및 구성 요소 점수
혼합 유형 변수 (연속 및 이진)로 구성된 데이터 세트에 PCA를 적용하고 싶습니다. 절차를 설명하기 위해 아래의 R에 최소한의 재현 가능한 예를 붙여 넣습니다. # Generate synthetic dataset set.seed(12345) n <- 100 x1 <- rnorm(n) x2 <- runif(n, -2, 2) x3 <- x1 + x2 + rnorm(n) x4 <- rbinom(n, 1, …
13 r  pca 

2
R 대 Excel의 자기 상관 공식
R이 랙 -k 자기 상관을 계산하는 방법을 알아 내려고 노력하고 있습니다 (분명히 Minitab과 SAS에서 사용하는 것과 같은 수식입니다). 그래서 시리즈와 k-lagged 버전에 적용된 Excel의 CORREL 함수를 사용하여 비교할 수 있습니다. R과 Excel (CORREL 사용)은 약간 다른 자기 상관 값을 제공합니다. 또한 한 계산이 다른 계산보다 더 정확한지 알고 싶습니다.
13 r  sas  autocorrelation  excel 

1
R에서 로지스틱 회귀 출력 해석
R을 사용하여 다중 로지스틱 회귀 분석을 수행하고 glm있습니다. 예측 변수는 연속적이고 범주 적입니다. 모델 요약을 추출하면 다음이 표시됩니다. Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 2.451e+00 2.439e+00 1.005 0.3150 Age 5.747e-02 3.466e-02 1.658 0.0973 . BMI -7.750e-02 7.090e-02 -1.093 0.2743 ... --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 …


7
금본위 제의 의미는 무엇입니까?
몇 가지 논문을 읽는 동안 "골드 세트"또는 "골드 표준"이라는 용어를 발견했습니다. 내가 이해하지 못하는 것은 데이터 세트 골드 표준을 만드는 것입니까? 동료 수용, 인용 횟수 및 연구원의 자유와 문제와의 관련성에 대해 공격하고 있습니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.