통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
Kolmogorov–Smirnov 검정의 간단한 동등성 검정 버전이 있습니까?
콜 모고 로프-스 미르 노프 (Kolmogorov–Smirnov) 검정에 대해 두 개의 일 방성 검정 (TOST)이 두 개의 분포 가 적어도 일부 연구원이 지정한 수준에 따라 다른 부정적 귀무 가설을 검정하도록 구성 되었습니까? TOST가 아닌 경우 다른 형태의 동등성 검정? Nick Stauner는 현명하게도 확률 론적 동등성에 대한 귀무 가설에 대한 다른 비모수 …

3
'천장 효과'가 발생하고 있다고 결론을 내려면 어떤 기준을 충족해야합니까?
사회 과학 연구 방법의 SAGE 백과 사전에 따르면 … [a] 상한 효과는 측정 값이 잠재적 인 반응에 대한 뚜렷한 상한을 보유하고 참가자의이 집중도가이 한도 또는 그 근처에있을 때 발생합니다. 스케일 감쇠는 이러한 방식으로 분산이 제한 될 때마다 발생하는 방법 론적 문제입니다. … 예를 들어, 높은 점수는 좋은 태도를 나타내고 높은 …

3
다단계 / 계층 구조 데이터의 임의 포리스트
나는 기계 학습, CART 기술 등을 처음 접했고, 순진한 것이 너무 명확하지 않기를 바랍니다. Random Forest는 다단계 / 계층 적 데이터 구조를 어떻게 처리합니까 (예 : 교차 수준 상호 작용이 필요한 경우)? 즉, 여러 계층 적 수준에서 분석 단위가 포함 된 데이터 세트 ( 예 : 학교 내에 중첩 된 …

1
PCA 로딩을 해석하는 방법?
PCA에 대해 읽으면서 다음과 같은 설명을 들었습니다. 각 데이터 포인트가 수학 시험, 물리 시험, 독해 시험 및 어휘 시험에서 단일 학생의 점수를 나타내는 데이터 세트가 있다고 가정하십시오. 데이터의 변동성의 90 %를 포착하고 그로드를 해석하는 처음 두 가지 주요 구성 요소를 찾습니다. 첫 번째 주요 구성 요소는 전반적인 학업 능력을 나타내고 …
13 pca 

3
불확실성을 가진 여러 측정의 표준 편차
샘플링 속도가 1Hz (7200 회 측정) 인 2 시간의 GPS 데이터가 2 개 있습니다. 데이터는 . 여기서 는 측정 불확실성입니다.N σ( X, Xσ, Y, Yσ, Z, Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma)엔σNσN_\sigma 모든 측정의 평균 (예 :이 두 시간의 평균 Z 값)을 취하면 표준 편차는 무엇입니까? 물론 Z 값에서 표준 …

1
중복 제거 기술
레코드 중복 제거의 최첨단 방법은 무엇입니까? 중복 제거는 레코드 연결, 엔터티 확인, ID 확인, 병합 / 지우기라고도합니다. 예를 들어 CBLOCK [1]에 대해 알고 있습니다. 답변에 메소드를 구현하는 기존 소프트웨어에 대한 참조도 포함되어 있다면 감사하겠습니다. 예를 들어 Mahout이 캐노피 클러스터링을 구현 한다는 것을 알고 있습니다. Lucene을 사용하는 Duke 도 있습니다 . …

4
알려진 모든 분포가 단조로운 이유는 무엇입니까?
나는 다중 모달 분포를 모른다. 알려진 모든 분포가 단조로운 이유는 무엇입니까? 하나 이상의 모드를 가진 "유명한"배포판이 있습니까? 물론, 분포의 혼합은 종종 복합적인 것이지만, 하나 이상의 모드를 갖는 "비 혼합"분포가 있는지 알고 싶습니다.


1
모형에 척도 데이터가 적합했을 때 예측을하기 위해 새로운 관측치를 축척하는 방법
선형 회귀 모델에 사용하기 위해 데이터 매트릭스를 스케일링하는 개념을 이해합니다. 예를 들어 R에서는 다음을 사용할 수 있습니다. scaled.data <- scale(data, scale=TRUE) 내 유일한 질문은 출력 값을 예측하려는 새로운 관찰에 대해 어떻게 정확하게 스케일링되는 것입니까? 그럴까요 scaled.new <- (new - mean(data)) / std(data)?

1
차단의 표준 오차가 왜 가 0에서 증가 합니까?
절편 용어의 표준 오차 ( )에서 주어진다 여기서 는 의 평균 의., Y=β1X+β0+εSE( β 0)2=σ2[1β^0β^0\hat{\beta}_0y=β1x+β0+εy=β1x+β0+εy=\beta_1x+\beta_0+\varepsilonˉxxi에스이자형( β^0)2= σ2[ 1엔+ x¯2∑엔나는 = 1( x나는− x¯)2]SE(β^0)2=σ2[1n+x¯2∑i=1n(xi−x¯)2]SE(\hat{\beta}_0)^2 = \sigma^2\left[\frac{1}{n}+\frac{\bar{x}^2}{\sum_{i=1}^n(x_i-\bar{x})^2}\right]엑스¯x¯\bar{x}엑스나는xix_i 내가 이해 한 바에 따르면, SE는 불확실성을 정량화합니다. 예를 들어 표본의 95 %에서 에는 실제 이 포함됩니다 . 로 불확실성의 척도 인 SE가 어떻게 증가하는지 …

3
극도로 치우친 분포 변환
분포가 매우 긍정적으로 치우친 변수가 있다고 가정하여 정규 분포의 비대칭 범위 내에 로그를 가져 오기에 충분하지 않습니다. 이 시점에서 내 옵션은 무엇입니까? 변수를 정규 분포로 변환하려면 어떻게해야합니까?

3
Lindsay Smith의 튜토리얼을 사용하여 R에서 PCA를 단계별로 구현
Lindsay I Smith 의 훌륭한 PCA 튜토리얼을 통해 R에서 일하고 있으며 마지막 단계에 갇혀 있습니다. 아래의 R 스크립트는 원래 데이터가 (이 경우 단수) Principal Component에서 재구성되는 단계 (p.19)로 이동하여 PCA1 축을 따라 직선 플롯을 생성합니다 2 차원 만 있고, 2 차원은 의도적으로 떨어집니다). d = data.frame(x=c(2.5,0.5,2.2,1.9,3.1,2.3,2.0,1.0,1.5,1.1), y=c(2.4,0.7,2.9,2.2,3.0,2.7,1.6,1.1,1.6,0.9)) # mean-adjusted values …
13 r  pca 

1
일반화 선형 모형의 기하학적 해석
선형 모델의 경우 : 우리는 OLS를 통해 추정 모델의 좋은 기하학적 해석 할 수 있습니다 Y = X β + 전자 . Y는 공간은 x와 잔류에 의해 스팬 (Y)의 투영이다 즉 ,이 공간 (X)에 의해 스팬에 수직이다.y=xβ+ey=xβ+ey=x\beta+ey^=xβ^+e^y^=xβ^+e^\hat{y}=x\hat{\beta}+\hat{e}y^y^\hat{y}e^e^\hat{e} 이제 내 질문은 : 일반화 선형 모델 (로지스틱 회귀, Poission, 생존)에 대한 기하학적 …


1
MLE 및 OLS 사용
정규 최소 제곱 대신 최대 가능성 추정을 사용하는 것이 언제 바람직한가요? 각각의 장점과 한계는 무엇입니까? 일반적인 상황에서 각각을 사용할 위치에 대한 실용적인 지식을 수집하려고합니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.