통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
용암 생산량을 어떻게 해석합니까?
를 사용하여 확인 요인 분석 (CFA)을 시도하고 lavaan있습니다. 에 의해 생성 된 출력을 해석하는 데 어려움을 겪고 lavaan있습니다. 수집 된 설문 조사 데이터의 항목이 지원하는 4 가지 요소가있는 간단한 모델이 있습니다. 요인은 유효한 측정의 역할을 할 가능성이있는 것처럼 항목에 의해 측정 된 것과 일치합니다. 도움 나에 의해 생성 된 다음과 …


1
어느 것이 더 빠르거나, 평균적이거나 중간에 수렴합니까?
N (0,1)에서 iid 변수를 그리면 평균 또는 중앙값이 더 빨리 수렴됩니까? 얼마나 빨리? 보다 구체적으로, 엑스1, x2, ...엑스1,엑스2,…x_1, x_2, \ldots 를 N (0,1)에서 가져온 일련의 iid 변수로 지정하십시오. 정의 및 중앙값으로 . 또는 중 어느 것이 0으로 빠르게 수렴 됩니까? ~ x n{x1,x2,…xn}{ ˉ x n}{ ~ x n}엑스¯엔= 1엔∑엔나는 …

2
로지스틱 및 로짓 선형 회귀로 추정 한 계수는 언제 다릅니 까?
연속적인 비율 (예 : 측량 사분면에서의 비례 식생 덮개 또는 활동에 종사하는 시간의 비율)을 모델링 할 때, 로지스틱 회귀는 부적절한 것으로 간주됩니다 (예 : Warton & Hui (2011) 아크 사인은 비사 인적입니다 : 생태학에서의 비율 분석 ). 오히려 로짓 변환 후 비율 또는 베타 회귀 후의 OLS 회귀가 더 적합합니다. …
11 r  regression  logistic 

2
파이썬의 QQ 플롯
다음 코드를 사용하여 qq 플롯을 생성했습니다. qq 플롯은 데이터가 정상적으로 분포되어 있는지 여부를 확인하는 데 사용됩니다. 내 질문은 x 및 y 축 레이블이 qq 플롯에서 무엇을 나타내며 r 제곱 값을 나타내는 것은 무엇입니까 ?? N = 1200 p = 0.53 q = 1000 obs = np.random.binomial(N, p, size = q)/N …

1
서수 데이터 표시-평균, 중간 및 평균 순위
정규 분포가 아닌 서수 데이터가 있으므로 Mann-Whitney U 테스트를 사용하여 비모수 테스트를 수행하기로 결정했습니다. 7 개의 점수에 대한 그룹 간 차이를보고 있습니다.이 점수는 각 과목에 대해 0, 1, 2 또는 3입니다. 데이터를 표시하는 방법을 알아내는 데 어려움을 겪고 있습니다! 중앙값 (및 중앙값의 IQR)을 사용하여 데이터를 표시 할 경우 대부분의 중앙값이 …

2
바틀렛 테스트 대 레벤 테스트
현재 분산 분석 가정에 대한 위반을 해결하려고합니다. 나는 Shapiro-Wilk를 사용하여 정규성을 테스트했으며 Levene의 검정과 Bartlett의 분산 평등 검정을 모두 다루었습니다. 이후 로그가 불균형 분산을 시도하고 수정하기 위해 데이터를 변환했습니다. 나는 로그 변환 된 데이터에 대한 Bartlett의 테스트를 다시 수행했지만 여전히 중요한 p- 값을 받았으며 호기심으로 Levene의 테스트를 실행하여 중요하지 않은 …

1
R-올가미 회귀-회귀마다 다른 람다
나는 다음을하고 싶다 : 1) 베타 계수를 얻기위한 OLS 회귀 (벌칙 없음) b∗jbj∗b_{j}^{*} ; jjj 는 회귀에 사용되는 변수를 나타냅니다. 나는 이것을한다 lm.model = lm(y~ 0 + x) betas = coefficients(lm.model) 2) 벌칙 용어를 사용한 올가미 회귀 선택 기준은 다음과 같이 주어진 베이지안 정보 기준 (BIC)이어야합니다. λj=log(T)T|b∗j|λj=log⁡(T)T|bj∗|\lambda _{j} = \frac{\log …
11 r  regression  glmnet  lars 

1
음 이항 / 포아송 회귀에서 과분 산과 과소 산포
SAS에서 포아송 회귀 분석을 수행 한 결과 자유 도로 나눈 Pearson 카이 제곱 값이 약 5 인 것으로 나타났습니다. 이는 상당한과 분산을 나타냅니다. 그래서, 나는 proc genmod를 가진 음 이항 모델에 적합하고 Pearson 카이 제곱 값을 자유 도로 나눈 값은 0.80이라는 것을 알았습니다. 이것이 현재 분산되어 있지 않은 것으로 간주됩니까? …

2
MANOVA의 귀무 가설은 무엇입니까?
배경 서로 다른 그룹 사이의 일부 연속 변수의 차이 (범주 형 변수에 의해 제공됨)를 분석하기 위해 일원 분산 분석을 수행 할 수 있습니다. 설명 적 (범주 형) 변수가 여러 개인 경우 요인 분산 분석을 수행 할 수 있습니다. 여러 연속 변수 (즉, 여러 반응 변수)에서 그룹 간 차이를 분석하려면 다변량 …

3
유형 I 및 II 오류의 확률이 음의 상관 관계가 있습니까?
I는 타입 I의 에러의 확률로 있다고하는 TA 명시된 교수라고 초등학교 통계 클래스 증가 유형 II 에러의 확률 감소하고, 그 반대가 아니라 사실이다. 따라서 이것은 입니다.αα\alphaββ\betaρα,β&lt;0ρα,β&lt;0\rho_{\alpha, \beta} < 0 그러나 일반적인 가설 검정에서 이것을 어떻게 증명할 수 있습니까? 그 진술은 일반적으로 사실입니까? 특정 사례 (예 및 )를 시도 할 수는 있지만 …

1
전체 성공을 가진 범주 형 변수가있는 이항 glmm
이항 반응 변수와 범주 형 예측 변수로 glmm을 실행하고 있습니다. 무작위 효과는 데이터 수집에 사용 된 중첩 디자인에 의해 제공됩니다. 데이터는 다음과 같습니다. m.gen1$treatment [1] sucrose control protein control no_injection ..... Levels: no_injection control sucrose protein m.gen1$emergence [1] 1 0 0 1 0 1 1 1 1 1 1 0 …

2
독립 변수를 사용하여 표준 편차가 조정되는 비율 추정
나는이 정규 분포 변수의 측정 복용하고있는 실험이 ,YYY Y∼N(μ,σ)Y∼N(μ,σ)Y \sim N(\mu,\sigma) 그러나 이전의 실험 표준 편차 몇 가지 증거 제공 한 독립 변수의 아핀 함수 , 즉Xσσ\sigmaXXX σ=a|X|+bσ=a|X|+b\sigma = a|X| + b Y∼N(μ,a|X|+b)Y∼N(μ,a|X|+b)Y \sim N(\mu,a|X| + b) 여러 값에서 를 샘플링 하여 매개 변수 와 를 추정하고 싶습니다 . 또한 …


2
여기에 1을 추가하면이 트릭은 무엇입니까?
Lillefors 테스트의 Monte Carlo 구현 에서이 페이지 를 보고있었습니다 . 이 문장을 이해하지 못합니다 : 시뮬레이션에서이 계산에 임의의 오류가 있습니다. 그러나 P- 값을 계산할 때 분자와 분모에 1을 더하는 트릭으로 인해 임의성을 고려하지 않고 바로 사용할 수 있습니다. 분자와 분모에 1을 더하는 것의 의미는 무엇입니까? 관련 코드는 다음과 같습니다. n …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.