통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
왜 파라 메트릭 부트 스트랩을 사용합니까?
저는 현재 파라 메트릭 부트 스트랩에 관한 몇 가지 문제를 해결하려고 노력하고 있습니다. 대부분 사소한 것이지만 여전히 무언가를 놓친 것 같습니다. 파라 메트릭 부트 스트랩 절차를 사용하여 데이터에 대한 신뢰 구간을 얻고 싶다고 가정합니다. 저는이 샘플을 가지고 있으며 정규 분포를 가정합니다. 그런 다음 분산 및 평균 \ hat {m}을 추정하고 …

2
미시 경제학의 인과 관계 vs 시계열 경제학의 그레인저 인과 관계
저는 미시 경제학 (특히 IV 또는 회귀 불연속 설계)에서 사용되는 인과 관계와 시계열 계량 경제학에서 사용되는 Granger 인과 관계를 이해합니다. 서로를 어떻게 관련 시키는가? 예를 들어, 패널 데이터에 사용되는 두 가지 접근법 (예 : , T = 20 ) 을 보았습니다 . 이와 관련하여 논문에 대한 언급은 인정 될 것이다.T …

2
Bartlett 's Test로 진단 된 구 형성이 PCA가 부적절하다는 것을 의미하는 이유는 무엇입니까?
Bartlett 's Test는 표본이 분산이 같은 모집단에서 추출한 것인지 결정하는 데 관심이 있음을 이해합니다. 표본이 분산이 동일한 모집단에서 추출 된 경우 검정의 귀무 가설을 기각 할 수 없으므로 주성분 분석이 부적절합니다. 이 상황에서 문제가 어디에 있는지 확실하지 않습니다 (동성 데이터 세트가 있음). 모든 데이터의 기본 분포가 동일한 데이터 세트의 문제점은 …

3
R : gbm과 RandomForest의 부분 의존도에서 무엇을 볼 수 있습니까?
실제로, 나는 부분 의존성 플롯으로 보여줄 수있는 것을 이해했다고 생각했지만 매우 간단한 가상의 예를 사용하여 다소 당황했습니다. 다음 코드 청크에서 나는 3 개의 독립 변수 ( a , b , c )와 하나의 종속 변수 ( y )를 생성하고 c 는 y 와 밀접한 선형 관계를 나타내는 반면 a 와 …

1
커널 대역폭 : Scott과 Silverman의 규칙
스콧과 실버 맨의 대역폭 선택 규칙의 차이점이 무엇인지 일반 영어로 설명 할 수 있습니까? 특히, 때 하나가 다른 것보다 낫다? 기본 분포와 관련이 있습니까? 샘플 수는? 추신 : 나는 SciPy의 코드를 언급하고 있습니다.


1
거리 상관의 직관적 특성이 있습니까?
나는 거리 계산에 의해 특징 지워지는 거리 상관 관계 에 대해 wikipedia 페이지를 쳐다보고 있다. 계산을 할 수는 있지만 거리 상관 측정 이 무엇인지, 계산이 왜 그렇게 보이는지 이해하기 어려워합니다. 측정 거리를 이해하는 데 도움이되는 거리 상관 관계에 대한 직관적 인 특징이 있습니까? 나는 직관 을 요구하는 것이 다소 모호하다는 …

1
DBSCAN에 대해 eps 및 minPts를 선택하는 루틴
DBSCAN은 일부 문헌에 따르면 가장 많이 인용되는 클러스터링 알고리즘이며 밀도에 따라 임의의 모양 클러스터를 찾을 수 있습니다. 그것은 두 개의 매개 변수 eps (인접 반경으로)와 minPts (점을 핵심 지점으로 고려하기위한 최소 이웃으로)를 가지고 있습니다. 이러한 매개 변수를 선택하기 위해 일상적으로 사용되는 방법이 있습니까?


3
밀도 추정은 어디에 유용합니까?
약간 간결한 수학을 겪은 후에는 커널 밀도 추정에 약간의 직관이 있다고 생각합니다. 그러나 나는 또한 세 가지 이상의 변수에 대한 다변량 밀도를 추정하는 것이 추정기의 통계적 특성 측면에서 좋은 생각이 아닐 수 있음을 알고 있습니다. 그렇다면, 비모수 적 방법을 사용하여 이변 량 밀도를 어떤 종류의 상황에서 추정하고 싶습니까? 두 개 …

3
R을 사용하여 다중 회귀 분석에서 각 예측 변수에 의해 설명 된 분산 계산
모델 전체가 중요하고 분산의 약 13 %를 설명하는 다중 회귀 분석을 실행했습니다. 그러나 각 중요한 예측 변수가 설명하는 분산의 양을 찾아야합니다. R을 사용하여 어떻게 할 수 있습니까? 샘플 데이터 및 코드는 다음과 같습니다. D = data.frame( dv = c( 0.75, 1.00, 1.00, 0.75, 0.50, 0.75, 1.00, 1.00, 0.75, 0.50 ), …
14 r  regression  variance 

2
R에 발견 된 군집의 중심을 취하여 군집을 새로운 데이터 세트에 할당하는 기능이 있습니까?
내가 다차원 데이터 세트의 두 부분으로,의 그들을 부르 자 train와 test. 열차 데이터 세트를 기반으로 모델을 빌드 한 다음 테스트 데이터 세트에서 모델을 검증하려고합니다. 클러스터 수는 알려져 있습니다. R에서 k- 평균 군집화를 적용하려고 시도했으며 군집 중심을 포함하는 객체를 얻었습니다. kClust <- kmeans(train, centers=N, nstart=M) R에 발견 된 군집의 중심을 취하여 …
14 r  clustering  k-means 


4
ARMA-GARCH를 적용하려면 고 정성이 필요합니까?
재무 시계열에 ARMA-GARCH 모델을 사용하고 해당 모델을 적용하기 전에 시리즈가 고정되어야하는지 궁금합니다. 나는 ARMA 모델을 적용하는 것을 알고 시리즈가 고정되어 있어야하지만 GARCH 오류를 포함하기 때문에 ARMA-GARCH는 확실하지 않습니다. 왜냐하면 변동성 클러스터링 및 불일치 분산을 의미하므로 변환이 무엇이든간에 정지되지 않은 시리즈입니다. . 재무 시계열은 일반적으로 고정 또는 비 정적입니까? 나는 몇 …


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.