통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
다른 알고리즘 대신 k- 평균을 사용하는 이유는 무엇입니까?
나는 k- 평균에 대해 연구했고 이것들은 내가 얻은 것입니다 : k- 평균은 감독되지 않은 학습 방법을 사용하여 알려진 클러스터링 문제를 해결하는 가장 간단한 알고리즘 중 하나입니다. 큰 데이터 세트에서 실제로 잘 작동합니다. 그러나 K-Means의 단점은 다음과 같습니다. 특이 치 및 노이즈에 대한 강한 감도 비 원형 클러스터 형태에서는 제대로 작동하지 …

3
대신
나는 다음과 같은 이론적 경제 모델을 가지고 있습니다. y=a+b1x1+b2x2+b3x3+uy=a+b1x1+b2x2+b3x3+u y = a + b_1x_1 + b_2x_2 + b_3x_3 + u 따라서 이론에 따르면 y 를 추정하기위한 x1x1x_1 , x2x2x_2 및 x3x3x_3 요인이 있습니다.yyy 이제 실제 데이터가 있고 b1b1b_1 , b2b2b_2 , 을 추정해야합니다 b3b3b_3. 문제는 실제 데이터 세트에 x1x1x_1 및 …


1
모집단 R- 제곱의 편향 추정치 란 무엇입니까?
다중 선형 회귀 분석에서 편견없는 추정치를 얻는 데 관심이 있습니다.R2R2R^2 생각해 볼 때, 편견없는 추정치 가 일치하려고 하는 두 가지 다른 값을 생각할 수 있습니다.R2R2R^2 샘플 중 :R2R2R^2 회귀 방정식은 샘플로부터 얻어진 경우에 획득 될 것이다 R 제곱 ) 시료의 외부에 데이터의 무한한 양이지만 동일한 데이터 생성 프로세스에서 적용되었다.β^β^\hat{\beta} 모집단 …

6
활동에서 독립 변수로 소비 한 시간
선형 모델에서 무언가 (예를 들어 모유 수유)를 독립 변수로 포함시키는 데 시간을 포함하고 싶습니다. 그러나 일부 관찰은 동작에 전혀 관여하지 않습니다. 0이 0보다 큰 값과 질적으로 다르기 때문에 0으로 코딩하는 것은 실제로 옳지 않습니다. 내가 생각해 낼 수있는 최선의 방법은 소요 시간을 분류하는 일련의 인형이지만, 이것은 귀중한 정보의 낭비입니다. 0으로 …

3
두 기울기 값 사이의 유의미한 차이 테스트
내가 가지고있는 데이터는 두 가지 다른 영역의 특정 종에 대한 y ~ 시간의 회귀 기울기 값, 표준 오류, n 값 및 ap 값입니다. 한 영역의 회귀 기울기가 다른 영역의 회귀 기울기와 크게 다른지 확인하고 싶습니다. 이러한 데이터로 가능합니까? 누구든지 내가 이것에 대해 어떻게 할 수 있습니까? 불행히도 원시 데이터에 액세스 …


1
잔차를 찾고 플로팅하는 방법
나는 데이터를 받았다 x = c(21,34,6,47,10,49,23,32,12,16,29,49,28,8,57,9,31,10,21,26,31,52,21,8,18,5,18,26,27,26,32,2,59,58,19,14,16,9,23,28,34,70,69,54,39,9,21,54,26) y = c(47,76,33,78,62,78,33,64,83,67,61,85,46,53,55,71,59,41,82,56,39,89,31,43,29,55, 81,82,82,85,59,74,80,88,29,58,71,60,86,91,72,89,80,84,54,71,75,84,79) 잔차를 구하고 대 잔차를 어떻게 구할 수 있습니까? 잔차가 거의 정상으로 보이는지 어떻게 테스트 할 수 있습니까?xxx 방정식 얻었을 때 원래 선형 피팅을 올바르게 수행하는지 확실하지 않지만 강의 노트는 선형 회귀 선이 y i = β 0 + β 1 …
14 r  regression 

2
Quantile 모델링의 모델 성능
나는 중간 회귀에 중점을 두지 않고 대신 높은 양자 (예 : 75 번째) 를 통해 Quantile Regression (예 : via gbm또는 quantregR)을 사용하고 있습니다. 예측 모델링 배경에서 모델이 테스트 세트에 얼마나 적합한 지 측정하고이를 비즈니스 사용자에게 설명 할 수 있기를 원합니다. 내 질문은 어떻게? 연속 대상이있는 일반적인 설정에서 다음을 수행 …

1
OLS 계수보다 크거나
능선 회귀 분석을 실행할 때 최소 제곱 미만의 특정 계수보다 큰 계수를 어떻게 해석합니까 (특정 값의 경우 )? 능선 회귀는 단조 적으로 계수를 축소하도록되어 있지 않습니까?λλ\lambda 관련 메모에서, 능선 회귀 동안 부호가 변하는 계수를 어떻게 해석합니까 (예 : 능선 추적은 능선 추적 플롯에서 음에서 양으로 교차합니다)?

1
임의 포리스트에서 LASSO 사용
다음 프로세스를 사용하여 임의의 포리스트를 만들고 싶습니다. 정보 획득을 사용하여 분할을 결정하는 임의의 데이터 및 기능 샘플에 트리를 구축 사전 정의 된 깊이를 초과하는 리프 노드를 종료하거나 분할하면 사전 정의 된 최소값보다 작은 리프 수가 생성됩니다. 각 트리에 클래스 레이블을 지정하는 대신 리프 노드에서 클래스 비율을 지정하십시오. 미리 정의 된 …

1
예측 성능은 방법보다는 데이터 분석가의 전문 지식에 더 의존합니까?
나는 일부 연구에서 예측 모델의 성능이 분석법의 선택보다는 선택된 분석법에 대한 데이터 분석가의 전문 지식에 더 의존한다는 소문을 발견했습니다. 다시 말해, 주장은 데이터 분석가가보다 이론적 인 관점에서 본 방법이 문제에 대해 "적절한"것으로 보이는 것보다 선택된 방법에 익숙한 것이 더 중요하다는 주장이다. 이것은 일반적으로 많은 변이체 (100-1000), 다중 공선 성 및 …


1
관련된 다른 시계열에서 하나의 시계열을 예측하는 방법
나는 많은 진보없이 1 년 이상이 문제를 해결하려고 노력해 왔습니다. 그것은 내가하고있는 연구 프로젝트의 일부이지만 문제의 실제 영역은 약간 혼란 스럽기 때문에 내가 만든 이야기 예제로 설명 할 것입니다 (눈 추적). 당신은 대양을 가로 질러 이동하는 적의 함선을 추적하는 비행기이므로, 당신은 그 함선의 일련의 (x, y, time) 좌표를 수집했습니다. 당신은 …

2
공간 자기 상관성 대 공간 고 정성
2 차원 공간에 점이 있다고 가정 하고 속성 y 에 대한 속성 의 영향을 측정하려고합니다 . 전형적인 선형 회귀 모델은 물론 y = X β + ϵ엑스엑스X와이와이yy=Xβ+ ϵy=엑스β+ϵy= X\beta + \epsilon 여기에는 두 가지 문제가 있습니다. 첫 번째는 항이 공간적으로 상관 될 수 있고 (독립적이고 동일한 오류 가정을 위반 함) …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.