통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

5
특이 치를 탐지하는 간단한 방법이 있습니까?
특이 치를 탐지하는 간단한 방법이 있는지 궁금합니다. 기본적으로 응답자가 일주일 동안 신체 활동에 참여한 횟수와 일주일 동안 집 밖에서 먹는 횟수 (패스트 푸드) 사이의 상관 관계인 내 프로젝트 중 하나에 대해, 나는 산점도를 그렸습니다. 극단적 인 데이터 포인트. 산점도는 음의 상관 관계를 나타 냈습니다. 이는 가치 판단 (이러한 데이터 요소가 …

5
1 클래스 텍스트 분류는 어떻게합니까?
텍스트 분류 문제를 해결해야합니다. 웹 크롤러는 특정 도메인의 웹 페이지를 크롤링하며 각 웹 페이지에 대해 특정 클래스에만 속하는지 여부를 확인하고 싶습니다. 즉,이 클래스를 Positive 호출하면 크롤링 된 각 웹 페이지는 Positive 클래스 또는 Non-Positive 클래스에 속합니다 . Positive 클래스에 대한 대규모 교육용 웹 페이지가 이미 있습니다 . 그러나 가능한 비 …

3
신경망 숨겨진 활성화 기능의 선택
NN에서 숨겨진 레이어 활성화 기능의 선택은 사용자의 필요 에 따라 달라져야한다는 것을 다른 곳에서 읽었습니다 . 내 질문은 필요한 것이 무엇인지 어떻게 알 수 있습니까? 입력 레이어의 범위를 기준으로합니까? 예를 들어 입력 레이어의 전체 값 범위를 포괄 할 수있는 함수를 사용하거나 입력 레이어의 분포를 반영하는 기능을 사용합니까 (가우스 함수)? 또는 …

1
보정 된 데이터에 대한 Kolmogorov-Smirnov 테스트의 대안이 있습니까?
나는 두 개의 샘플 (대조군과 처리 군)에서 R에 대한 유의성 테스트를 받아야하는 수천 개의 값을 포함하는 많은 데이터를 얻었습니다. 이론적으로, 값은 연속적이어야하지만 측정 소프트웨어에 의한 반올림으로 인해 그리고 그들은 유대를 가지고있다. 분포는 알 수 없으며 제어 및 처리 분포의 모양이 다를 수 있으므로 비모수 검정을 사용하여 표본 간의 차이가 10 …

2
선거에서 후보자가 승자가 될 것이라는 확신을 어떻게 알 수 있습니까?
내가 어제 살았던 총선이 있었고, 텔레비전 네트워크는 모든 투표 용지가 열리기 오래 전에 승자를 부르기 시작했습니다. 그들은 모든 계좌에서 올바르게 밝혀졌으며, 그들이 그렇게 놀랐다는 것은 놀라운 일이 아닙니다. 나는 통계가 절대적으로 실행 가능하다는 것을 알고 있습니다. 그래도 궁금합니다. 가정 : 우리는 j 투표 용지에서 iii 를 열었습니다 .jjj 현재 점수가 …
14 elections 

2
MCMC Geweke 진단
Metropolis 샘플러 (C ++)를 실행 중이며 이전 샘플을 사용하여 수렴 률을 추정하려고합니다. 내가 찾은 진단을 쉽게 구현할 수있는 Geweke 진단 은 두 표본 평균의 차이를 추정 된 표준 오차로 나눈 값을 계산합니다. 표준 오차는 0의 스펙트럼 밀도로부터 추정됩니다. Zn=θ¯A−θ¯B1nASAθ^(0)+1nBSBθ^(0)−−−−−−−−−−−−−−−−√,Zn=θ¯A−θ¯B1nASθA^(0)+1nBSθB^(0),Z_n=\frac{\bar{\theta}_A-\bar{\theta}_B}{\sqrt{\frac{1}{n_A}\hat{S_{\theta}^A}(0)+\frac{1}{n_B}\hat{S_{\theta}^B}(0)}}, 여기서 , B 는 Markov 체인 내에있는 두 개의 창입니다. 나는 …
14 mcmc  diagnostic 

5
AIC를 사용하여 모델 선택을 적용하면 변수에 중요하지 않은 p- 값이 제공되는 이유
AIC에 대해 궁금한 점이 있으시면 도와 드리겠습니다. 데이터에 AIC를 기반으로 모델 선택 (뒤로 또는 앞으로)을 적용했습니다. 그리고 선택된 변수 중 일부는 p- 값> 0.05로 끝났습니다. 사람들은 p- 값 대신 AIC를 기반으로 모델을 선택해야한다고 말하고 있기 때문에 AIC와 p- 값은 두 가지 차이점 개념 인 것 같습니다. 누군가 차이점이 무엇인지 말해 …

3
고정 / 무작위 효과 모델의 개념
고정 / 무작위 효과 모델을 이해하도록 도와 줄 수 있습니까? 이러한 개념을 요약 한 경우 나만의 방식으로 설명하거나 특정 주소 (페이지 번호, 챕터 등)가있는 리소스 (도서, 메모, 웹 사이트)로 안내하여 혼동없이 배울 수 있습니다. "일반적으로 고정 된 효과가 있고 임의의 효과는 특정한 경우"입니까? 설명이 일반 모델에서 고정 및 임의 효과가있는 …

5
QQ 플롯 중심 근처의 불필요한 점 제거
R에서 약 120 만 포인트의 두 데이터 세트로 QQ 플롯을 플로팅하려고합니다 (qqplot 사용 및 ggplot2에 데이터 공급). 계산은 쉽지만 결과 그래프는로드가 너무 느립니다. 점이 너무 많기 때문입니다. 점 수를 10000으로 줄이기 위해 선형 근사법을 시도했지만 (데이터 세트 중 하나가 다른 것보다 큰 경우 qqplot 함수가 수행하는 작업입니다) 꼬리의 세부 사항을 …

1
파생물의 커널 밀도 추정기를위한 최적의 대역폭이 있습니까?
커널 밀도 추정기를 사용하여 일련의 관측 값을 기반으로 밀도 함수를 추정해야합니다. 동일한 관측치에 기초하여, 커널 밀도 추정기의 도함수를 사용하여 밀도의 1 차 및 2 차 도함수도 추정해야합니다. 대역폭은 확실히 최종 결과에 큰 영향을 미칩니다. 먼저 KDE 대역폭을 제공하는 몇 가지 R 기능이 있다는 것을 알고 있습니다. 어느 것이 더 선호되는지 …

2
통계적으로 유의 한 피크 확인
데이터 세트 와 x가 있습니다. 다음과 같은 가설을 테스트하고 싶습니다 . y에 피크가 있습니다 . 즉, x가 증가하면 y는 먼저 증가한 다음 감소합니다.yyyxxxyyyxxxyyy 내 첫 번째 아이디어는 SLR에 와 x 2 를 맞추는 것이 었습니다 . 즉, x 이전의 계수 가 상당히 양의 값이고 x 2 이전의 계수가있는 경우xxxx2x2x^2xxxx2x2x^2 가 …

3
GAM 모델의 신뢰 구간
mgcv::gam의 도움말 페이지 읽기 : 적합 모델을 사용하여 예측 된 수량에 대해 신뢰 / 신뢰할 수있는 간격을 쉽게 사용할 수 있습니다. 그러나 실제로 얻을 수있는 방법을 알 수는 없습니다. 나는 생각했다 predict.gam것 type=confidence과 level매개 변수를하지만 그렇지 않습니다. 어떻게 만드는지 도와 줄 수 있습니까?

1
범주 형 변수 사이의 교호 작용이 포함 된 경우 혼합 모형의 회귀 출력 해석
혼합 모델 / lmer 사용에 대한 질문이 있습니다. 기본 모델은 다음과 같습니다. lmer(DV ~ group * condition + (1|pptid), data= df) 그룹과 조건은 모두 요인입니다. 그룹에는 두 가지 수준 (groupA, groupB)이 있고 조건에는 세 가지 수준 (condition1, condition2, condition3)이 있습니다. 그것은 인간 대상의 데이터이므로 pptid는 각 사람에게 무작위 효과입니다. 모델은 …

2
베이지안 분석을위한 최적의 소프트웨어 패키지
베이지안 추론을 수행하기 위해 어떤 소프트웨어 통계 패키지를 권장하는지 궁금합니다. 예를 들어, openBUGS 또는 winBUGS를 독립형으로 실행하거나 R에서 호출 할 수 있다는 것도 알고 있습니다. 그러나 R에는 베이지안 분석을 수행 할 수있는 자체 패키지 (MCMCPack, BACCO)도 있습니다. R의 어떤 베이지안 통계 패키지가 가장 좋거나 다른 대안 (Matlab 또는 Mathematica)에 대한 …

1
신경망에서 이진 입력과 연속 입력의 혼합을 처리하는 방법은 무엇입니까?
R의 nnet 패키지를 사용하여 콘도 (개인 프로젝트)의 부동산 가격을 예측하기 위해 ANN을 작성하려고합니다. 나는 이것에 익숙하지 않으며 수학 배경이 없으므로 나와 함께 맨손으로하십시오. 이진 및 연속 입력 변수가 있습니다. 예를 들어 원래 예 / 아니오였던 일부 이진 변수는 신경망에 대해 1/0으로 변환되었습니다. 다른 변수는 다음과 같이 연속적 Sqft입니다. 입력 데이터 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.