통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
언제 GMM 사용을 고려해야합니까?
계량 경제학을 독특하게 만드는 것 중 하나는 Generalized Method of Moments 기법을 사용하는 것입니다. GMM이 다른 추정 기술보다 더 적합한 문제는 무엇입니까? GMM을 사용하면 효율성이나 바이어스 감소 또는보다 구체적인 파라미터 추정 측면에서 무엇을 구매합니까? 반대로 MLE 등을 통해 GMM을 사용하면 무엇을 잃게됩니까?


1
치수가 증가함에 따라 정규 분포의 밀도
내가 묻고 싶은 질문은 이것입니다 : 정규 분포 평균의 1 SD 내의 샘플 비율은 변이 수가 증가함에 따라 어떻게 변합니까? (거의) 모든 사람들은 1 차원 정규 분포에서 표본의 68 %가 평균의 1 표준 편차 내에서 발견 될 수 있다는 것을 알고 있습니다. 2, 3, 4, ... 치수는 어떻습니까? 나는 그것이 …

4
한 변수의 표준 편차가 0 인 경우 상관 관계는 무엇입니까?
알다시피, 방정식을 사용하여 공분산을 정규화하여 상관 관계를 얻을 수 있습니다 ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} 여기서 σi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]} 는의 표준 편차입니다XiXiX_i. 표준 편차가 0이면 내 관심사는 무엇입니까? 0이 될 수 없다는 조건이 있습니까? 감사.

2
기능 수가 증가하면 정확도가 떨어지지 만 pre / recall이 증가합니다.
저는 머신 러닝을 처음 사용합니다. 현재 NLTK와 python을 사용하여 작은 클래스의 텍스트를 양, 음 또는 중립으로 분류하기 위해 Naive Bayes (NB) 분류기를 사용하고 있습니다. 300,000 개의 인스턴스 (16,924 긍정 7,477 네거티브 및 275,599 개의 중립)로 구성된 데이터 세트를 사용하여 일부 테스트를 수행 한 후 피처 수를 늘리면 정확도는 떨어지지 만 …

9
음이 아닌 데이터의 표준 편차가 평균을 초과 할 수 있습니까?
삼각 측량 된 3D 메쉬가 있습니다. 삼각형 영역에 대한 통계는 다음과 같습니다. 최소 0.000 최대 2341.141 평균 56.317 표준 개발 98.720 따라서 표준 편차에 특히 유용한 것이거나 수치가 위와 같이 작동 할 때 계산에 버그가 있음을 암시합니까? 이 지역은 정규 분포와는 거리가 멀다. 그리고 아래의 답변 중 하나에서 언급 한 …

6
"정책"변경으로 인한 시계열 데이터의 중대한 변화를 감지하는 방법은 무엇입니까?
나는 이것이이 글을 올릴 수있는 장소가 되었으면 좋겠다. 회의론자들에게 게시하는 것을 고려했지만, 그들이 연구가 통계적으로 잘못되었다고 생각했을 뿐이다. 나는 그것을 올바르게하는 방법 인 질문의 반대면이 궁금합니다. Quantified Self 웹 사이트 에서 저자는 시간이 지남에 따라 스스로 측정 된 일부 측정 결과에 대한 실험 결과를 게시하고 갑자기 커피를 마시기 전과 후에 …

5
다른 분류 자의 장단점을 비교하는 좋은 자료는 무엇입니까?
가장 뛰어난 2 급 분류기는 무엇입니까? 예, 그것은 백만 달러짜리 질문이라고 생각합니다. 그리고 무료 점심 식사 정리 를 알고 있습니다. 그리고 이전 질문도 읽었습니다. 어플리케이션에 가장 적합한 2 등급 분류기는 무엇입니까? 그리고 최악의 분류 아직도, 나는 그 주제에 대해 더 많은 것을 읽고 싶습니다. 다른 분류기의 특징, 장점 및 특징에 …

1
ggplot으로 계단 단계 함수를 그리는 방법은 무엇입니까?
잠김 . 이 질문과 주제는 주제가 다르지만 역사적 의미가 있기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. 나는 이런 그래프를 가지고있다 : 그것을 생성하기위한 R 코드는 다음과 같습니다. DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, 1, 0.1)) DF <- DF[order(DF$DateVariable),] #Sort by date …

1
시계열의 인접 행렬의 고유 함수?
간단한 시계열을 고려하십시오. > tp <- seq_len(10) > tp [1] 1 2 3 4 5 6 7 8 9 10 이 시계열에 대한 인접 행렬을 계산하여 샘플 간의 시간적 링크를 나타냅니다. 이 행렬을 계산할 때 우리는 시간 0에 가상의 사이트를 추가하고이 관찰과 시간 1의 첫 번째 실제 관찰 사이의 링크를 …

3
한 모집단의 임의 구성원이 다른 모집단의 임의 구성원보다 "더 나은"확률을 어떻게 추정 할 수 있습니까?
두 개의 다른 모집단에서 표본 추출이 있다고 가정합니다. 각 구성원이 작업을 수행하는 데 걸리는 시간을 측정하면 각 모집단의 평균 및 분산을 쉽게 추정 할 수 있습니다. 이제 각 모집단의 한 개인과 임의의 쌍을 가정한다고 가정하면 첫 번째가 두 번째보다 빠를 확률을 추정 할 수 있습니까? 구체적인 예를 염두에두고 있습니다. 측정은 …

1
R의 자동차 패키지와 ANOVA 대비를 설정하고 해석하는 방법은 무엇입니까?
분산 분석을 수행하려는 간단한 2x2 요인 실험이 있다고 가정하겠습니다. 예를 들면 다음과 같습니다. d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); 중요한 상호 작용의 부재, 기본적으로 (즉,에서 contr.treatment의) 출력 Anova()의 전체적인 의미한다 a모든 수준의 이상 …
15 r  anova  contrasts 


4
투표에 대한 평판의 영향에 대한 분석을 개선하려면 어떻게해야합니까?
최근에는 평판에 영향을 미치는 업 보트 ( blog-post 참조)에 대한 분석을 수행 한 후 , 더 많은 깨달음 (또는 더 적절한) 분석 및 그래픽에 대한 몇 가지 질문이있었습니다. 따라서 몇 가지 질문이 있습니다 (특히 누군가에게 자유롭게 대답하고 다른 사람들은 무시하십시오). 화신의 현재에서, 나는 포스트 번호의 중심을 의미하지 않았다. 포스트 카운트의 …

2
R의 커널 밀도 추정에서 "pdf"영역
커널 밀도 추정을 위해 R 의 ' density '기능 을 사용하려고합니다 . 곡선 아래 면적이 반드시 1 인 것처럼 보이지 않기 때문에 결과를 해석하고 다양한 데이터 세트를 비교하는 데 약간의 어려움이 있습니다. 확률 밀도 함수 (pdf) 경우 입니다. 커널 밀도 추정치가 pdf를보고한다고 가정합니다. 내가 사용하고 integrate.xy 에서 sfsmisc 곡선 아래의 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.