통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
지수 상한
분포가 IID 임의 변수 이 있다고 가정 합니다. 우리는 다음과 같은 방식으로 의 샘플을 관찰 할 것입니다 : 이 독립 랜덤 변수가되게하자, 모든 와 가 독립적이며 표본 크기 . Y_i '의 어떤들 표시 x_i로부터 시료에의'우리는에 의해 정의 된 샘플에서 성공의 분율을 연구하고자 X1,…,XnX1,…,XnX_1,\dots,X_nBer(θ)Ber(θ)\mathrm{Ber}(\theta)XiXiX_iY1,…,YnY1,…,YnY_1,\dots,Y_nBer(1/2)Ber(1/2)\mathrm{Ber}(1/2)XiXiX_iYiYiY_iN=∑ni=1YiN=∑i=1nYiN=\sum_{i=1}^n Y_iYiYiY_iXiXiX_iZ={1N∑ni=1XiYi0ifN>0,ifN=0.Z={1N∑i=1nXiYiifN>0,0ifN=0. Z = \begin{cases} \frac{1}{N}\sum_{i=1}^n X_i Y_i …

3
A / B 테스트에 사용할 통계 테스트는 무엇입니까?
우리는 각각 1000 샘플의 두 집단을 가지고 있습니다. 각 코호트 당 2 개의 수량을 측정합니다. 첫 번째는 이진 변수입니다. 두 번째는 두꺼운 꼬리 분포를 따르는 실수입니다. 각 측정 항목에 가장 적합한 동질 집단을 평가하려고합니다. 사람들은 z-test를 제안하고, 다른 사람들은 t-test를 사용하고, 다른 사람들은 Mann-Whitney U를 선택할 수 있습니다. 사례별로 각 …
12 ab-test 


3
알 수없는 분포의 데이터를 정규화하는 방법
특정 유형의 반복 측정 데이터 중 가장 적절한 특성 분포를 찾으려고합니다. 본질적으로 지질학 분야에서는 종종 사건이 발생한 기간 (암석이 임계 온도 이하로 냉각 됨)을 찾기 위해 표본 (암석 덩어리)에서 광물의 방사성 연대 측정을 사용합니다. 일반적으로 각 샘플에서 여러 (3-10) 측정이 수행됩니다. 그리고, 평균 및 표준 편차 σ 가 취해진 다. …

1
항상 부트 스트랩 CI를 사용하지 않는 이유는 무엇입니까?
부트 스트랩 CI (및 Barticular의 BCa)가 정규 분포 데이터에서 어떻게 수행되는지 궁금합니다. 다양한 유형의 분포에서 성능을 검사하는 작업이 많지만 정규 분포 데이터에서 아무것도 찾을 수 없습니다. 먼저 공부해야 할 것이 분명해 보이므로 논문이 너무 오래되었다고 생각합니다. R 부트 패키지를 사용하여 Monte Carlo 시뮬레이션을 수행하고 부트 스트랩 CI가 정확한 CI와 일치하는 …

5
매우 많은 수의 데이터 포인트에서 값을 대치하는 방법은 무엇입니까?
데이터 세트가 매우 커서 약 5 %의 임의 값이 없습니다. 이 변수들은 서로 상관되어 있습니다. 다음 예제 R 데이터 세트는 더미 상관 데이터가있는 장난감 예제 일뿐입니다. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- paste ("M", 1:10000, sep ="") rownames(xmat) …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 

2
예측 간격으로 확률 론적 진술을 할 수 있습니까?
사이트에서 신뢰 구간과 예측 구간의 해석에 관한 많은 훌륭한 토론을 읽었지만 한 가지 개념은 여전히 ​​약간 수수께끼입니다. OLS 프레임 워크를 고려하고 우리는 피팅 모델 획득 한 Y = X β를 . 우리는 x *를 받았으며 그 반응을 예측하도록 요청 받았다. 우리는 계산 X * T의 β를 보너스로, 우리는 또한 우리의 …

1
Lmer 모델이 수렴하지 않습니다
내 데이터는 여기에 설명되어 있습니다 . 반복 측정 ANOVA를 피팅 할 때 "ov (Error () model is singleular error)"가 발생하는 원인은 무엇입니까? lmer내 기본 사례는 다음을 사용하여 상호 작용의 효과를 보려고합니다 . my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) my.model <- lmer(value ~ Condition*Scenario+ (1|Player)+(1|Trial), data = …
12 r  lme4-nlme 


2
이 분포가 왜 균일합니까?
우리는 베이지안 통계 테스트를 조사하고 있으며 이상한 현상을 겪고 있습니다. 다음과 같은 경우를 고려하십시오. A 또는 B 인구가 ​​어느 전환율이 더 높은지 측정하는 데 관심이 있습니다. 온 전성 검사의 경우 설정합니다 . 즉, 변환 확률이 두 그룹에서 동일합니다. 이항 모델을 사용하여 인공 데이터를 생성합니다. 예 :pA=pBpA=pBp_A = p_BnA∼Binomial(N,pA)nA∼Binomial(N,pA)n_A \sim \text{Binomial}(N, …

1
선형 혼합 효과 모델의 결과보고
선형 혼합 효과 모델은 생물학 분야에서 일반적으로 사용되지 않으며, 작성하려는 논문에서 사용한 통계 테스트를보고해야합니다. 다중 수준 모델링에 대한 인식이 생명 과학의 일부 영역에서 나타나기 시작한다는 것을 알고 있습니다 ( 종속성에 대한 솔루션 : 중첩 된 데이터를 수용하기 위해 다중 수준 분석 사용 ) 결과를보고하는 방법을 배우려고 여전히 노력하고 있습니다! 내 …

2
지능 제곱 채점 및 승자 결정
Intelligence Squared라는 NPR 팟 캐스트가 있습니다. 각 에피소드는 "제 2 개정안은 더 이상 관련이 없습니다"또는 "대학 캠퍼스에서의 긍정 조치가 좋은 것보다 더 해 롭습니다"와 같은 논쟁적인 진술에 대한 실시간 토론을 방송합니다. 4 명은 토론에 2 명, 반대 2 명에 대해 토론합니다. 어느 쪽이 이길 지 결정하기 위해 토론 전후에 청중이 …
12 bayesian  rating 

2
분산-공분산 행렬 해석
선형 모델이 Model1있고 vcov(Model1)다음 행렬을 제공 한다고 가정하십시오 . (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 이 예제에서이 매트릭스는 실제로 무엇을 표시합니까? 모델과 독립적 변수에 대해 안전하게 어떤 가정을 할 수 있습니까?

1
부트 스트랩 테스트를 수행하여 두 샘플의 평균을 비교하는 방법은 무엇입니까?
두 개의 심하게 치우친 표본이 있으며 부트 스트랩을 사용하여 t- 통계량을 사용하여 평균을 비교하려고합니다. 올바른 절차는 무엇입니까? 내가 사용하고있는 과정 나는 이것이 정규 분포가 아니라는 것을 알고 마지막 단계에서 원본 / 관측 된 데이터의 표준 오차를 사용하는 것이 적절 할까 걱정하고 있습니다. 내 단계는 다음과 같습니다. 부트 스트랩-무작위 샘플 교체 …

2
일반화 선형 모형에서 정규성 잔차 확인
이 논문 은 일반 선형 모델 (이항 및 음 이항 오차 분포)을 사용하여 데이터를 분석합니다. 그러나 방법의 통계 분석 섹션에는 다음과 같은 진술이 있습니다. 두 번째는 로지스틱 회귀 모델을 사용하여 현재 상태 데이터를 모델링하고 GLM (Generalized Linear Model)을 사용하여 시간을 계산하는 데이터입니다. 로그 링크 기능이있는 음의 이항 분포는 위조 시간 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.