통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
커널 PCA 용 커널을 선택하는 방법은 무엇입니까?
커널 PCA (주성분 분석)가 최종 데이터 출력에서 ​​어떤 커널을 선택하여 데이터를 양호하게 분리 할 수있는 방법은 무엇이며 커널의 매개 변수를 최적화하는 방법은 무엇입니까? 가능한 경우 Layman의 용어를 높이 평가할 것이며 그러한 방법을 설명하는 논문 링크도 좋습니다.

1
(d-prime)과 AUC (ROC 곡선 아래 영역) 사이의 연결 ; 기본 가정
기계 학습에서는 시스템 이 두 범주를 얼마나 잘 구별 할 수 있는지를 요약하기 위해 ROC 곡선 아래 영역 (대개 약어 AUC 또는 AUROC)을 사용할 수 있습니다. 신호 검출 이론에서 종종 (감도 지수) 는 비슷한 목적으로 사용됩니다. 이 두 가지는 밀접하게 연결되어 있으며 특정 가정이 충족되면 서로 동등 하다고 생각 합니다.d′d′d' …

6
갑작스런 변화를 특징 짓는 방법?
이 질문은 너무 기본적 일 수 있습니다. 데이터의 일시적인 추세를 위해 "급격한"변경이 발생하는 지점을 찾고 싶습니다. 예를 들어 아래에 표시된 첫 번째 그림에서 통계 방법을 사용하여 변경 지점을 찾고 싶습니다. 그리고 변경 지점이 분명하지 않은 다른 데이터 (예 : 두 번째 그림)에 이러한 방법을 적용하고 싶습니다. 그러한 목적을위한 일반적인 방법이 …

2
Poisson, Gamma 또는 Tweedie 분포를 오류 분포의 패밀리로 사용하여 Python / scikit-learn에서 GLM을 평가할 수 있습니까?
Python과 Sklearn을 배우려고하지만 Poisson, Gamma 및 특히 Tweedie 제품군의 오류 분포를 사용하는 회귀를 실행해야합니다. 나는 그것들에 관한 문서에서 아무것도 보지 못했지만 R 배포판의 여러 부분에 있기 때문에 누군가 파이썬의 구현을 보았는지 궁금합니다. Tweedie 배포판의 SGD 구현으로 나를 가리킬 수 있다면 매우 시원 할 것입니다!

1
선형 혼합 효과 모델의 결과를 설명하기위한 플롯
나는 R에서 선형 혼합 효과 모델링을 사용하여 일부 데이터를 분석했습니다. 결과가 담긴 포스터를 만들 계획이며 혼합 효과 모델을 경험 한 사람이 결과를 설명하는 데 사용할 플롯을 제안 할 수 있는지 궁금합니다. 모델. 잔차 그림, 적합치 대 원래 값의 그림 등을 생각하고있었습니다. 나는 이것이 내 데이터에 크게 의존한다는 것을 알고 있지만 …

2
GLM에서 더미 (수동 또는 자동) 변수 생성 이해
요인 변수 (예 : M 및 F 수준의 성별)가 glm 공식에 사용되는 경우 더미 변수가 생성되며 관련 계수 (예 : genderM)와 함께 glm 모델 요약에서 찾을 수 있습니다 이러한 방식으로 인수를 분할하기 위해 R을 사용하는 대신 일련의 숫자 0/1 변수 (예 : genderM (M의 경우 1, F의 경우 F), genderF …

3
다른 샘플 크기에서 p 값의 상대적 크기
p 값의 상대적 크기는 다른 샘플 크기에서 어떻게 변합니까? 상관 관계에 대해 에서 을 얻은 다음 에서 동일한 p 값 0.20을 얻은 경우, 원래 p 값과 비교하여 두 번째 테스트의 p 값의 상대 크기는 얼마입니까? 때 ?p=0.20p=0.20p=0.20n=45n=45n=45n=120n=120n=120n=45n=45n=45

1
확률 적 경사 하강 (SGD)에 적합한 미니 배치 크기 선택
확률 적 경사 하강을 수행 할 때 미니 배치 크기 선택을 검토하는 문헌이 있습니까? 내 경험상, 그것은 일반적으로 교차 검증 또는 다양한 경험 규칙을 통해 발견되는 경험적 선택 인 것 같습니다. 유효성 검사 오류가 감소함에 따라 미니 배치 크기를 천천히 늘리는 것이 좋습니까? 이것이 일반화 오류에 어떤 영향을 미칩니 까? …

4
실제 응용 분야에서 교체하지 않고 샘플링을 고려해야하는 이유는 무엇입니까?
교체를 통한 샘플링은 내가 볼 때 교체하지 않고 샘플링하는 것보다 두 가지 장점이 있습니다. 1) 유한 모집단 수정에 대해 걱정할 필요가 없습니다. 2) 모집단의 요소가 여러 번 그려 질 수 있으므로 측정 값을 재활용하고 시간을 절약 할 수 있습니다. 물론 학술 POV에서 두 가지 방법을 모두 조사해야합니다. 그러나 실용적인 POV에서 …

2
R을 사용하여 Cox 모델에서 기준 위험 함수를 추정하는 방법
시간 의존적 콕스 모델에서 기준 위험 함수 를 추정해야합니다.λ0(t)λ0(t)\lambda_0(t) λ(t)=λ0(t)exp(Z(t)′β)λ(t)=λ0(t)exp⁡(Z(t)′β)\lambda(t) = \lambda_0(t) \exp(Z(t)'\beta) Survival 과정을 수강하는 동안 Breslow 추정기가 단계 함수를 제공하기 때문에 누적 위험 함수 ( ) 의 직접 파생물은 좋은 추정량이 아니라는 것을 기억합니다.λ0(t)dt=dΛ0(t)λ0(t)dt=dΛ0(t)\lambda_0(t) dt = d\Lambda_0(t) 그래서 R에 직접 사용할 수있는 기능이 있습니까? 또는이 주제에 대한 참조가 …
13 r  survival  cox-model 

4
가우스 프로세스 : 다차원 출력에 GPML을 사용하는 방법
GPML을 사용하여 다차원 출력에 대해 가우시안 프로세스 회귀를 수행하는 방법이 있습니까? 데모 스크립트 에서는 1D 예제 만 찾을 수있었습니다. 다차원 입력 사례를 다루는 이력서에 대한 비슷한 질문 . 나는 무엇을 찾을 수 있는지 알아보기 위해 그들의 책을 살펴 보았습니다. 이 책 의 9 장 (섹션 9.1)에서는 여러 출력의 경우를 언급했습니다. …

3
2 차 고정 프로세스 란 무엇입니까?
그의 "2 차 고정 프로세스"가 Brockwell과 Davis의 시계열 및 예측 소개 에서 어떻게 정의되는지 궁금합니다 . ARMA (Autoregressive Moving-average) 클래스를 포함하는 선형 시계열 모델 클래스는 고정 프로세스를 연구하기위한 일반적인 프레임 워크를 제공합니다. 실제로 모든 2 차 고정 프로세스 는 선형 프로세스이거나 결정적 구성 요소를 빼서 선형 프로세스로 변환 할 수 …

3
확률 분포에 대한 초보자를위한 권장 도서
나는 기계 학습과 내가 연 모든 책을 공부하면서 카이 제곱 분포, 감마 함수, t 분포, 가우스 등을 만납니다. 지금까지 열었던 모든 책은 분포가 무엇인지 만 정의합니다. 함수에 대한 특정 공식의 출처에 대해서는 설명하거나 직관을 제공하지 않습니다. 예를 들어 카이 제곱 분포가 왜 그런가? t- 분포는 무엇입니까? 분포의 직관은 무엇입니까? 증거? …

3
통계 : 알파와 베타의 관계
내 질문은 알파와 베타의 관계와 통계의 정의와 관련이 있습니다. 알파 = 유형 I 오류율 = NULL 가설이 올바른 것으로 간주되는 유의 수준 베타 = 유형 II 오류율 알파가 낮아지면 (알파 = 1- 특이성으로 특이도가 증가) 베타가 증가합니다 (베타 = 1-민감도 / 전력으로 민감도 / 전력 감소) 알파 변경은 베타에 어떤 …

1
교호 작용 항과 고차 다항식
선형 설명 변수 와 종속 변수 와의 2 차 관계를 갖는 다른 설명 변수 사이의 양방향 상호 작용에 관심이 있다면 , 2 차 성분과의 상호 작용과 선형과의 상호 작용을 모두 포함해야합니다 모델의 구성 요소? 예 : 이전 스레드를 바탕으로 빌드 : 곡률 항 및 모델 선택 ( 이것이 R에서 사용하는 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.