통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
커널 근사에 대한 Nystroem 방법
나는 낮은 순위의 커널 aproximation을위한 Nyström 방법에 대해 읽었습니다. 이 방법은 scikit-learn [1]에서 구현되어 커널 기능 매핑의 낮은 순위에 데이터 샘플을 투사하는 방법으로 사용됩니다. 내가 아는 한, 훈련 세트 과 커널 함수가 주어지면 SVD를 에 적용 하여 커널 매트릭스 의 낮은 순위 근사값을 생성합니다. 및 .{xi}ni=1{xi}i=1n\{x_i\}_{i=1}^nn×nn×nn \times nKKKWWWCCC K=[WK21KT21K22]K=[WK21TK21K22]K = …


5
마르코프 체인을 돌이킬 수없는 방법은 무엇입니까?
나는 마르코프 체인 속성을 이해할 수없는 이해하는 데 어려움이 있습니다. Irreducible은 확률 적 프로세스가 "모든 상태에서 어떤 상태로든 갈 수 있음"을 의미한다고합니다. 그러나 그것이 상태에서 벗어날 수 있는지 여부를 정의하는 것 iii 상태로 jjj또는 갈 수 없습니까? 위키 피 디아 페이지 공식화을 제공합니다 : 상태 jjj인 접근 (작성i→ji→ji\rightarrow j) 상태에서 …

3
VC 치수가 중요한 이유
Wikipedia 는 다음과 같이 말합니다. VC 차원은 알고리즘이 산산조각 낼 수있는 가장 큰 점 집합의 카디널리티입니다. 예를 들어 선형 분류기는 카디널리티 n + 1을 갖습니다. 내 질문은 왜 우리가 관심을 갖는가? 선형 분류를 수행하는 대부분의 데이터 세트는 매우 큰 경향이 있으며 많은 점이 포함됩니다.

3
멀티 클래스 분류기의 혼동 행렬을 작성하는 방법은 무엇입니까?
6 개의 수업에 문제가 있습니다. 그래서 다음과 같이 멀티 클래스 분류기를 작성합니다. 각 클래스마다 One vs. All을 사용하여 하나의 Logistic Regression 분류 기가 있습니다. 즉, 6 개의 다른 분류자가 있습니다. 분류기 각각에 대해 혼동 매트릭스를보고 할 수 있습니다. 그러나 여기 많은 예에서 보았 듯이 모든 분류 자에 대한 혼동 행렬을보고하고 …

1
Adaboost에서 의사 결정 그루터기를 약한 학습자로 사용하는 방법은 무엇입니까?
Decision Stump를 사용하여 Adaboost를 구현하고 싶습니다. Adaboost를 반복 할 때마다 데이터 세트의 기능만큼 많은 의사 결정을 내릴 수 있습니까? 예를 들어, 24 개의 기능이있는 데이터 세트가있는 경우 각 반복마다 24 개의 의사 결정 스텀프 분류 기가 있어야합니까? 아니면 무작위로 일부 기능을 선택하고 모든 기능 대신 분류기를 만들어야합니까?




2
auto.arima를 사용하여 결 측값을 대치하는 방법
누락 된 값이 많은 동물원 시리즈가 있습니다. auto.arima이 누락 된 값을 무시할 수 있다는 것을 읽었 습니까? 누구든지 어떻게 할 수 있습니까? 고마워요! 이것은 내가 시도했지만 성공하지 못했습니다. fit <- auto.arima(tsx) plot(forecast(fit))
12 arima 

1
시계열 모델에서 R- 제곱을 사용할 때의 문제점은 무엇입니까?
시계열 컨텍스트에서 R- 제곱을 사용하는 것이 적절하지 않다는 것을 읽었습니다. 다른 컨텍스트가 있음을 알고 있습니다 .R- 제곱은 더 이상 고유하지 않습니다. 왜 이런거야? 나는 이것을 찾으려고했지만 아무것도 찾지 못했습니다. 일반적으로 모델을 평가할 때 R- 제곱 (또는 조정 된 R- 제곱)에 많은 가치를 두지 않지만 많은 동료 (예 : 비즈니스 전공)는 …


3
불연속 분포와 연속 분포간에 KL 분기를 적용 할 수 있습니까?
나는 수학자가 아닙니다. KL Divergence에 대한 인터넷을 검색했습니다. 내가 배운 것은 KL 분기는 입력 분포와 관련하여 모델의 분포를 근사 할 때 손실되는 정보를 측정한다는 것입니다. 나는 두 개의 연속 또는 이산 분포 사이에서 이것을 보았습니다. 연속과 불연속 또는 그 반대로 할 수 있습니까?

3
동시 방정식 모델과 구조 방정식 모델의 차이점
아무도 동시 방정식 모델과 SEM (Structural Equation Model)의 차이점을 이해하도록 도와 줄 수 있습니까? 누군가 나에게 그것에 대한 몇 가지 문헌을 제공 할 수 있다면 좋을 것입니다. 또한 시계열 컨텍스트에서 SEM이 사용 된 문헌이 있습니까? 내가 얻는 문헌은 주로 단면 데이터 컨텍스트에서 SEM을 설명합니다. 감사합니다!

2
다중 선형 회귀 분석에 대한 최소 관측치 수
여러 선형 회귀 분석을 수행하고 있습니다. 21 개의 관측치와 5 개의 변수가 있습니다. 내 목표는 변수 간의 관계를 찾는 것입니다. 내 데이터가 다중 회귀를 수행하기에 충분히 설정 되었습니까? 내 변수 중 3 개가 유의하지 않은 것으로 밝혀진 t- 검정 결과. 중요한 변수로 회귀 분석을 다시 수행해야합니까 (또는 첫 회귀 분석으로 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.