통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
왜 ecdf는 선형 보간법이 아닌 스텝 함수를 사용합니까?
경험적 CDF 함수는 일반적으로 단계 함수에 의해 추정됩니다. 이것이 선형 보간을 사용하지 않고 이런 식으로 수행되는 이유가 있습니까? step 함수에 흥미로운 이론적 속성이 있습니까? 다음은 두 가지 예입니다. ecdf2 <- function (x) { x <- sort(x) n <- length(x) if (n < 1) stop("'x' must have 1 or more non-missing …
13 r  distributions  ecdf 

1
GBM 패키지와 GBM을 사용하는 Caret
을 사용하여 모델 튜닝을 수행 caret했지만 gbm패키지를 사용하여 모델을 다시 실행했습니다 . caret패키지가 사용 gbm하고 출력이 동일해야한다는 것을 이해합니다 . 그러나 data(iris)RMSE와 R ^ 2를 평가 지표로 사용하면 약 5 %의 모델에서 불일치가 발생합니다. 부분 종속성 플롯을 사용 하기 위해 최적의 모델 성능을 찾고 caret싶지만 다시 실행 하고 싶습니다 gbm. …

2
공분산 함수 또는 커널-정확히 무엇입니까?
나는 가우시안 프로세스 분야에 익숙하지 않고 머신 러닝에 어떻게 적용되는지에 대해 알고 있습니다. 공분산 함수가 이러한 방법의 주요 매력 인 것에 대해 계속 읽고 듣습니다. 그렇다면 누구나 이러한 공분산 함수에서 일어나는 일을 직관적으로 설명 할 수 있습니까? 그렇지 않으면 특정 자습서 또는 설명하는 문서를 가리킬 수 있습니다.


2
로지스틱 회귀 분석에 P> 0.5 컷오프가 "최적"이 아닌 이유는 무엇입니까?
PREFACE : 컷오프 사용의 장점 또는 컷오프 선택 방법에 대해서는 신경 쓰지 않습니다. 내 질문은 순전히 수학적이며 호기심 때문입니다. 로지스틱 회귀는 클래스 A 대 클래스 B의 사후 조건부 확률을 모델링하며 사후 조건부 확률이 동일한 초평면에 적합합니다. 따라서 이론적으로 0.5 분류 포인트는 사후 확률을 모델링하기 때문에 (균일 한 동일한 클래스 비율이 …


2
UMP가 없을 때 거부 영역을 정의하는 방법은 무엇입니까?
선형 회귀 모형을 고려하십시오. ,y = X β+ uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} ,u ∼N( 0 , σ2나 )u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) 입니다.이자형( u ∣ X ) = 0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} 대 H 1 : σ 2 0 ≠ σ 2로 하자 .H0: σ20= σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2H1: σ20≠ σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 y T M X y를 추론 할 수 있습니다, …

3
간단한 선형 회귀, p- 값 및 AIC
예를 들어 here 전에이 주제가 여러 번 나타났음을 알지만 여전히 회귀 출력을 해석하는 가장 좋은 방법을 확신하지 못합니다 . x 값 의 열과 y 값 의 열로 구성된 매우 간단한 데이터 세트가 있으며 위치 (loc) 에 따라 두 그룹으로 나뉩니다 . 포인트는 다음과 같습니다 동료는 우리가 사용했던 각 그룹에 별도의 …


2
회귀 모형의 분산 설명
이것은 간단한 설명 일 수 있습니다 (어쨌든 기대하고 있습니다). 회귀 도구 상자를 사용하여 Matlab에서 회귀 분석을 수행했습니다. 그러나 나는 이것을 나타내는 연구를 보았습니다. "회귀 분석을 사용하여 분산의 60 %를 설명하는 4 가지 음파 특징 만 사용하여 예측 모델을 설정할 수있었습니다." 필요한 경우 기사에 대한 링크는 여기에 있습니다 : 제 나는 …
13 variance 

2
정규 확률 변수의 합이 정규화되기 위해 결합 정규성이 필요한 조건입니까?
관련 질문에 대한 이 답변에 대한 주석 에서 사용자 ssdecontrol과 Glen_b 는 합계 X + Y 의 정규성을 주장하는 데 XXX 와 의 공동 정규성이 필요한지 여부를 물었습니다 . 물론 관절의 정상 성도 충분 합니다. 이 보충 질문은 거기에서 다루어지지 않았으며 아마도 그 자체로 고려할 가치가 있습니다.YYYX+YX+YX+Y 공동 정규성은 한계 …

1
F1 최적 임계 값은 무엇입니까? 그것을 계산하는 방법?
R에서 h2o.glm () 함수를 사용하여 결과에 우발성 테이블을 다른 통계와 함께 제공했습니다. 우발 사태 표는 " F1 최적 임계 값에 기초한 크로스 탭 "입니다. Wikipedia 는 F1 Score 또는 F Score를 조화와 정밀도의 조화 평균으로 정의합니다. 그러나 로지스틱 회귀의 예측 값 (예 : 결과)이 컷오프를 사용하여 이진으로 변환 된 경우에만 …
13 threshold 

2
대한 95 % 신뢰 구간 공식
stats.stackexchange에서 Google을 검색하고 검색했지만 선형 회귀 분석 의 값에 대한 95 % 신뢰 구간을 계산하는 공식을 찾을 수 없습니다 . 누구든지 그것을 제공 할 수 있습니까?아르 자형2R2R^2 더 나은 방법으로, R에서 아래의 선형 회귀를 실행했다고 가정 해 봅시다 . R 코드를 사용하여 R 값에 대한 95 % 신뢰 구간을 어떻게 …

3
인공 신경망의 이론적 결과
Coursera의 기계 학습 과정에서 인공 신경망을 방금 다루었 고 그 뒤에 더 많은 이론을 알고 싶습니다. 나는 그들이 생물학을 모방 한 동기가 다소 불만족 스럽다는 것을 안다. 표면에서 각 수준에서 공변량을 선형 조합으로 대체하는 것으로 보입니다. 반복적으로 수행함으로써 비선형 모델 피팅을 허용합니다. 이것은 왜 신경망이 때때로 비선형 모델에 적합하기를 선호하는지에 …

1
GINI와 AUC 곡선 해석의 차이점은 무엇입니까?
우리는 스코어 카드 모델링을 위해 좋은 비율과 나쁜 비율의 도움으로 생성 된 리프트를 사용하여 GINI 곡선을 만들었습니다. 그러나 내가 연구 한 것은 ROC 곡선이 x 축으로 특이성 (1- True Negative)과 Y 축으로 감도 (true positive)를 갖는 Confusion matrix를 사용하여 생성된다는 것입니다. 따라서 GINI와 ROC의 결과는 하나의 차이점과 동일하지만 후자는 또한 …
13 roc  gini 

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.