통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


4
이 경우 포아송 회귀는 선형 회귀에 비해 어떤 이점이 있습니까?
나는 한 고등학교에서 학생들이 얻은 상 수를 포함하는 데이터 세트를 받았는데, 여기에서 획득 한 상 수의 예측 변수에는 학생이 등록한 프로그램 유형과 최종 시험 점수가 포함됩니다. 선형 회귀 모델이 왜이 경우에 적합하지 않은지, 왜 포아송 회귀를 사용하는 것이 더 좋은지 말해 줄 수 있을지 궁금합니다. 감사.

1
분포없는 통계 / 방법과 비모수 통계의 차이점은 무엇입니까?
에서 위키 백과 비모수의 첫 번째 의미는 특정 분포에 속하는 데이터에 의존하지 않는 기술을 포함합니다. 여기에는 다음이 포함됩니다. 데이터가 주어진 확률 분포에서 도출된다는 가정에 의존하지 않는 분포가없는 방법. 따라서 파라 메트릭 통계와 반대입니다. 비모수 통계 모델, 추론 및 통계 테스트가 포함됩니다. 비모수 통계 (모수에 대한 의존성이없는 표본에 대한 함수로 정의 …

1
포아송 회귀 모형의 검증을위한 비용 함수
수집 한 카운트 데이터의 경우 포아송 회귀 분석을 사용하여 모델을 작성합니다. glmR 의 함수를 사용 하여이 작업을 수행 합니다 family = "poisson". 가능한 모델을 평가하기 위해 (여러 예측 변수가 있음) AIC를 사용합니다. 여태까지는 그런대로 잘됐다. 이제 교차 유효성 검사를 수행하고 싶습니다. 패키지 의 cv.glm함수를 사용하여 이미이 작업을 수행했습니다 boot. 에서 …

2
R에서 k- 평균 군집화 결과 해석
kmeansAnderson의 홍채 데이터 세트에서 k- 평균 알고리즘을 수행하기 위해 R 의 명령을 사용하고있었습니다 . 내가 얻은 일부 매개 변수에 대한 질문이 있습니다. 결과는 다음과 같습니다. Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 이 경우 "클러스터 의미"는 무엇을 의미합니까? 클러스터 내 모든 객체의 거리의 평균입니까? 또한 마지막 …

1
최소 제곱 대 일반화 선형 모형 대 비선형 최소 제곱을 사용하여 지수 함수 피팅
지수 붕괴를 나타내는 데이터 세트가 있습니다. 지수 함수 를이 데이터 에 맞추고 싶습니다 . 응답 변수를 로그 변환 한 다음 줄에 맞추기 위해 최소 제곱을 사용하려고했습니다. 반응 변수 주위에 로그 링크 함수 및 감마 분포를 갖는 일반화 된 선형 모델을 사용하는 단계; 비선형 최소 제곱을 사용합니다. 두 방법 모두 각 …


2
로지스틱 회귀 분석과 랜덤 포레스트 결과를 결합하는 방법은 무엇입니까?
나는 기계 학습을 처음 사용합니다. 로지스틱 회귀 및 임의 포리스트를 동일한 데이터 세트에 적용했습니다. 따라서 변수 중요성 (로지스틱 회귀의 절대 계수 및 임의의 포리스트의 변수 중요도)을 얻습니다. 최종 변수 중요성을 얻기 위해 두 가지를 결합하려고합니다. 누구나 자신의 경험을 공유 할 수 있습니까? 배깅, 부스팅, 앙상블 모델링을 확인했지만 필요한 것은 아닙니다. …

2
두 개의 선형 회귀 모델 비교
두 가지 조건에서 시간이 지남에 따라 mRNA의 분해 속도를 나타내는 두 개의 선형 회귀 모델을 비교하고 싶습니다. 각 모델의 데이터는 독립적으로 수집되었습니다. 다음은 데이터 세트입니다. 시간 (시간) 로그 (처리 A) 로그 (처리 B) 0 2.02 1.97 0 2.04 2.06 0 1.93 1.96 2 2.02 1.91 2 2.00 1.95 2 2.07 …

1
커널 화 된 k 가장 가까운 이웃
나는 커널을 처음 사용하고 kNN을 커널 화하려고 시도하면서 걸림돌을 쳤다. 예비 다항식 커널을 사용하고 있습니다. 케이( x , y ) = ( 1 + ⟨ X , Y ⟩ )디K(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d 일반적인 유클리드 kNN은 다음 거리 측정법을 사용합니다. 디( x , y ) = | …

1
감마 분포 X에 대한 Y의 밀도 = log (X)
이 질문은 이 게시물 과 밀접한 관련 이 있습니다 임의의 변수 가 있고 정의 합니다. 의 확률 밀도 함수를 찾고 싶습니다 .X∼Gamma(k,θ)X∼Gamma(k,θ)X \sim \text{Gamma}(k, \theta)Y=log(X)Y=log⁡(X)Y = \log(X)YYY 원래 누적 분포 함수 X를 정의하고 변수를 변경하고 적분의 "내부"를 밀도로 생각한다고 생각했습니다. P(X≤c)P(Y≤logc)=∫c01θk1Γ(k)xk−1e−xθdx=∫log(c)log(0)1θk1Γ(k)exp(y)k−1e−exp(y)θexp(y)dyP(X≤c)=∫0c1θk1Γ(k)xk−1e−xθdxP(Y≤log⁡c)=∫log⁡(0)log⁡(c)1θk1Γ(k)exp⁡(y)k−1e−exp⁡(y)θexp⁡(y)dy\begin{align} P(X \le c) & = \int_{0}^{c} \frac{1}{\theta^k} \frac{1}{\Gamma(k)} x^{k- …

2
PCA 솔루션은 독특합니까?
특정 데이터 세트에서 PCA를 실행할 때 솔루션이 고유합니까? 즉, 인터 포인트 거리를 기반으로 2D 좌표 세트를 얻습니다. 이러한 제약 조건을 충족하는 포인트의 배열을 하나 이상 찾을 수 있습니까? 대답이 예라면 어떻게 다른 해결책을 찾을 수 있습니까?
12 pca 

1
R에서 순서 로짓 예측
정렬 된 로짓 회귀 분석을 시도하고 있습니다. 나는 모델을 그렇게 운영하고 있습니다 (소득 및 인구 측정에서 시장의 회사 수를 추정하는 바보 같은 작은 모델). 내 질문은 예측에 관한 것입니다. nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) 예측을 실행하면 (예측 된 y를 얻는 데 사용하려고 함) 출력은 0, 3 또는 27이며, 계수에서 수동 …

2
임의 포리스트에 대한 캐럿을 사용한 기능 선택 및 매개 변수 조정
수천 개의 기능이있는 데이터가 있으며 정보가없는 기능을 제거하기 위해 재귀 적 기능 선택 (RFE)을 수행하려고합니다. 캐럿 과 RFE 로이 작업을 수행합니다 . 그러나 최상의 회귀 적합도 (예 : 임의 포리스트)를 얻으려면 언제 매개 변수 조정 ( mtryRF)을 수행해야하는지 생각하기 시작했습니다 . 즉, 캐럿이 이해하는 것처럼 고정 mtry로 다른 기능 하위 …

1
임의 포리스트 (또는 다른 분류기)를 사용한 계층화 된 분류
저는 약 60 x 1000의 행렬을 가지고 있습니다. 저는 1000 개의 특징을 가진 60 개의 물체로보고 있습니다; 60 개의 객체는 3 개의 클래스 (a, b, c)로 그룹화됩니다. 각 클래스에 20 개의 개체가 있으며 실제 분류를 알고 있습니다. 이 60 가지 교육 예제 세트에 대해지도 학습을하고 싶습니다. 분류기 정확도 (및 관련 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.