통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


1
정규성 위반 정도에 대한 좋은 지수는 무엇이며 해당 지수에 어떤 설명 레이블을 첨부 할 수 있습니까?
문맥: 이전 질문에서 @Robbie는 약 600 건의 연구 에서 정규성 검정이 유의미한 비정규 성을 제안했지만 플롯은 정규 분포를 제안한 이유를 조사했습니다 . 몇몇 사람들은 정규성의 유의성 검정이 그다지 유용하지 않다고 지적했습니다. 작은 표본의 경우 이러한 테스트는 경미한 정상 위반을 탐지 할 수있는 힘이 크지 않으며 큰 표본의 경우 걱정할 정도로 …

2
JAGS에서 제로 팽창 포아송을 어떻게 설정합니까?
R과 JAGS에서 제로 팽창 포아송 모델을 설정하려고합니다. 나는 JAGS를 처음 사용하고 있으며이를 수행하는 방법에 대한 지침이 필요하다. 나는 y [i]가 관측 된 변수 인 다음을 시도 해왔다 model { for (i in 1:I) { y.null[i] <- 0 y.pois[i] ~ dpois(mu[i]) pro[i] <- ilogit(theta[i]) x[i] ~ dbern(pro[i]) y[i] <- step(2*x[i]-1)*y.pois[i] + …

1
표본이 정규 분포를 따르지만 차이가없는 경우 쌍을 이루는 t- 검정을 사용할 수 있습니까?
나는 동일한 초기 조건에서 두 가지 다른 처리를 적용하여 각 경우에 0에서 500 사이의 정수를 결과로 얻은 실험 데이터를 가지고 있습니다. 두 처리에서 생성 된 효과가 크게 다른지 여부를 확인하기 위해 paired t-test를 사용하고 싶습니다. 각 치료군에 대한 결과는 정규적으로 분포되지만 각 쌍 간의 차이 는 정규적으로 분포 되지 않습니다 …

5
모든 정규성 검정에서 귀무 가설을 기각하는 이유는 무엇입니까?
Kolgomorov-Smirnov 검정, Shapiro 검정 등은 모두 분포가 정상이라는 가설을 기각합니다. 그러나 정규 Quantile과 막대 그래프를 그릴 때 데이터는 분명히 정상입니다. 아마도 시험의 힘이 높기 때문에? 표본 크기는 약 650입니다. 따라서 이러한 검정 중 하나 이상이 귀무 가설을 기각하지 않아야합니까? 결과 : Kolmogorov-Smirnov D 0.05031 Pr > D <0.010 Cramer-von Mises …

5
Numpy에서 효과적으로 가우스 커널을 계산하는 방법 [닫기]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 삼년 전에 . m 개의 열과 n 개의 행 이있는 numpy 배열이 있으며 열은 차원과 행 데이터 포인트입니다. 이제 각 데이터 포인트 조합에 대한 커널 값을 계산해야합니다. …

1
R의 혼합 데이터를위한 강력한 클러스터 방법
작은 데이터 세트 (4 개의 구간 변수 및 단일 3 요인 범주 형 변수에 대한 64 개의 관측치)를 군집화하려고합니다. 이제는 클러스터 분석을 처음 접했지만 계층 적 클러스터링 또는 k- 평균이 유일하게 사용 가능한 옵션이었던 시절부터 상당한 진전이 있었음을 알고 있습니다. 특히, chl 에 의해 지적 된 바와 같이 "적합성 지수를 …

3
공간 프로세스에 대한 파라미터 추정
나는 주어진있어 양의 정수 값의 격자. 이 숫자는 그리드 위치를 점유하는 사람의 믿음의 강도 (높은 믿음을 나타내는 높은 값)에 해당하는 강도를 나타냅니다. 사람은 일반적으로 여러 그리드 셀에 영향을 미칩니다.n × nn×nn\times n 나는 강도의 패턴이 "가우시안 (Gaussian)"이되어야한다고 생각하는데, 이는 강도의 중심 위치가있을 것이고, 그 강도는 모든 방향으로 방사상으로 가늘어진다. 구체적으로, …

5
좋은 색 강도 스케일을 만드는 방법은 무엇입니까?
나는 통계에 능숙하지 않지만, 내가 올바른 장소에 왔다고 생각한다. 내 질문은 간단합니다. 내 문제는 작은 나라의 여러 주 인구를 비교하는 것으로 구성되지만 일부 주에는 3000,000 명의 인구와 2,000 명의 인구가 있습니다. 지도에 그림을 칠하고 있으며 색상의 "강도"는 모든 국가의 인구가 전국의 인구와 어떻게 비교되는지에 달려 있습니다. 문제는 많은 인구를 가진 …

4
매우 높은 차원의 데이터에 대해 PCA를 수행하는 방법은 무엇입니까?
주성분 분석 (PCA)을 수행하려면 데이터에서 각 열의 평균을 빼고 상관 계수 행렬을 계산 한 다음 고유 벡터와 고유 값을 찾아야합니다. 오히려 상관 관계 계수 행렬 (corrcoef)을 찾는 방법으로 높은 차원의 배열을 사용할 수 없기 때문에 작은 행렬에서만 작동한다는 점을 제외하고는 파이썬에서 구현 한 것입니다. 이미지에 이미지를 사용해야하므로 현재 구현이 실제로 …
12 pca  python 


1
SVM 그리드 검색에 정확도가 낮은 영역이 표시되어야합니까?
나는 12 가지 양성 훈련 세트 (12 가지의 다른 작용 기전으로 약물로 치료 된 암세포)를 가지고 있습니다. 이러한 긍정적 인 훈련 세트 각각에 대해, 실험에서 샘플링 된 동일한 크기의 음수 세트와 구별되도록 서포트 벡터 머신을 훈련시키고 싶습니다. 각 세트는 1000에서 6000 사이의 셀을 가지며 각 셀에는 476 개의 피처 (이미지 …
12 svm 

4
전체 목록을 대체하지 않고 큰 목록에서 10의 많은 샘플을 채취하는 방법
큰 데이터 세트 (20,000 개의 데이터 포인트)가 있는데 여기에서 10 개의 데이터 포인트를 반복적으로 샘플링하려고합니다. 그러나 일단 10 개의 데이터 포인트를 선택한 후에는 다시 선택하지 않기를 원합니다. sample함수를 사용해 보았지만 함수를 여러 번 호출하지 않고도 샘플링 할 수있는 옵션이없는 것 같습니다. 이를 수행하는 간단한 방법이 있습니까?
12 r  sample 

1
프랙탈 수학에 기초한 통계
프랙탈 수학을 기반으로 한 통계에 관한 책 / 교과서를 찾고 있습니다. 나는 그것이 잘 알려진 영역이 아니며 좋은 문학을 찾기가 어렵다는 것을 안다. 모든 제안은 환영합니다 (도서, 교과서, 온라인 자료).

3
지연된 DV를 도구 변수로 사용하는 이유는 무엇입니까?
나는 계량 경제학자가 아닌 이해하기 위해 고심하고있는 일부 데이터 분석 코드를 물려 받았습니다. 한 모델은 다음 Stata 명령을 사용하여 도구 변수 회귀 분석을 실행합니다. ivreg my_dv var1 var2 var3 (L.my_dv = D2.my_dv D3.my_dv D4.my_dv) 이 데이터 세트는이 변수 세트에 대한 여러 순차적 관측치가있는 패널입니다. 이 코드가 DV의 지연된 값을 계측기로 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.