통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
희귀 한 이벤트 예측 모델을위한 오버 샘플링을 사용한 자루
다음이 설명되어 있는지, 그리고 어느 것이 든 불균형 목표 변수를 가진 예측 모델을 배우는 타당한 방법처럼 들리는 지 아는 사람이 있습니까? 데이터 마이닝의 CRM 응용 프로그램에서 종종 긍정적 이벤트 (성공)가 대다수 (음수 클래스)에 비해 매우 드문 모델을 찾습니다. 예를 들어, 0.1 %만이 긍정적 인 관심 대상 (예 : 고객이 구매 …

2
표준 오차 추정에 사용되는 프로파일 가능성의 헤센
이 질문은 이것에 의해 동기가 부여 됩니다 . 나는 두 가지 출처를 찾았으며 이것이 내가 찾은 것입니다. A. van der Vaart, 증상 통계 : 프로파일 가능성을 명시 적으로 계산하는 것은 거의 불가능하지만 수치 평가는 종종 가능합니다. 그러면 프로파일 우도는 우도 함수의 차원을 감소시키는 역할을 할 수있다. 프로파일 우도 함수는 종종 …

4
로지스틱 회귀 결과보고
다음과 같은 로지스틱 회귀 출력이 있습니다. Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.5716 0.1734 3.297 0.000978 *** R1 -0.4662 0.2183 -2.136 0.032697 * R2 -0.5270 0.2590 -2.035 0.041898 * 이를 다음과 같은 방식으로보고하는 것이 적절합니다. 베타 계수, 승산 비, Z 값, P 값. 그렇다면 홀수 비율을 어떻게 얻을 …
13 logistic 


2
검증 및 모델 선택을위한 부트 스트랩 이해
부트 스트랩 의 기본 원리가 어떻게 작동하는지 이해하고 있지만 모델 선택에 부트 스트랩을 사용하거나 과적 합을 피하는 방법을 잘 모르겠습니다. 예를 들어, 모델 선택의 경우 부트 스트랩 샘플에서 가장 낮은 오차 (아마도 편차)를 산출하는 모델을 선택 하시겠습니까? 모델 선택 또는 검증에 부트 스트랩을 사용하는 방법에 대해 설명하는 텍스트가 있습니까? 편집 …

3
콕스 비례 위험 모델의 위험 비율을 영어로보고하는 방법은 무엇입니까?
내 이해는 점이다 위험 비 콕스 비례 위험 모델에서이 기준 그룹에 소정의 위험 인자 율에 미치는 영향을 비교한다. 통계를 모르는 잠재 고객에게 어떻게보고 하시겠습니까? 예를 표현해 봅시다. 소파를 사기 전에 얼마나 오래 연구했는지 사람들을 등록한다고 가정 해 봅시다. 우리는 3 년에 오른쪽 검열을합니다. 이 예에서는 고양이를 소유하고 있는지 여부와 상관없이 …

2
머신 러닝 알고리즘에 필요한 확률의 기초를 배우는 가장 좋은 방법은 무엇입니까?
몇 년 전에 대학에서 확률 과정을 밟았지만 지금은 일부 기계 학습 알고리즘을 겪고 있으며 일부 수학은 단지 혼란 스럽습니다. 특히 현재 EM 알고리즘 (예상 최대화)을 배우고 있으며 필요한 것과 내가 가지고있는 것 사이에 큰 분리가있는 것 같습니다. 나는 책이나 웹 사이트를 요구하지 않지만, 그것들을 사용하는 알고리즘을 철저히 이해하기 위해 이러한 …

4
R에서 하나의 그래프에 여러 플롯을 그리시겠습니까?
다음 코드를 사용하여의 그래프에 네 개의 플롯을 그리려고했습니다 R. 플롯 사이에 공간이 많기 때문에 그림에 만족하지 않으므로 플롯의 너비가 플롯을 분석하기에 충분하지 않습니다. 누군가 네 개의 플롯이있는 멋진 그래프를 생성하도록 도와 줄 수 있습니까? x 축 레이블을 기본 5 레이블 대신 1에서 10으로 유지하려면 어떻게해야합니까? 데이터: a1 : 11.013 13.814 …

1
"통계 학습 요소"에서 표 18.1 재생
통계 학습 요소의 표 18.1은 14 개의 클래스 데이터 세트에서 여러 분류기의 성능을 요약합니다. 이러한 다중 클래스 분류 문제에 대해 새로운 알고리즘을 올가미 및 탄성 그물과 비교하고 있습니다. 사용 glmnet버전 1.5.3 (R 2.13.0) I 포인트 제합니다 (재현 할 아니다 에 사용 된 유전자의 수 (269) 및 테스트 오차 것으로보고 테이블에 …

5
R 버그에 대한 대안 만 [폐쇄]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 작년에 문을 닫았 습니다 . 나는 BUGS와 R을 사용하여 베이지안 통계에 대한 과정을 따르고 있습니다. 이제는 이미 BUGS를 알고 있습니다. R에 새로운 베이지안 패키지가 많이 있다는 것을 읽었습니다. …
13 r  bayesian  bugs 

1
시끄러운 관찰에서 진정한 평균 결정
양식 (mean, stdev)의 큰 데이터 포인트 집합이 있습니다. 나는 이것을 단일 (더 나은) 평균과 (희망적으로) 더 작은 표준 편차로 줄이고 싶습니다. 분명히 나는 ​​단순히 ∑ d a t a m e a n을 계산할 수 있었다 그러나이 데이터 포인트 중 일부는 상당히 다른 사람보다 더 정확하다는 사실을 고려하지 않은 것.∑ …

4
평균 제곱 오차가 한 추정기의 상대적인 우월성을 평가하는 데 사용됩니까?
어떤 매개 변수 대해 두 개의 추정기 및 가 있다고 가정하십시오 . 어떤 추정기가 "더 나은"지를 결정하기 위해 MSE (평균 제곱 오차)를 살펴 볼까요? 다시 말해 우리는 봅니다. 여기서 는 추정기의 치우침이고 는 추정기의 분산입니까? MSE가 더 큰 쪽이 더 나쁜 견적일까요?α 2 x M S E = β 2 …
13 estimation  mse 

2
R에서 ggplot2를 사용하는 두 가지 요소에 대한 상자 그림
잠김 . 이 질문과 주제는 주제가 다르지만 역사적 의미가 있기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. 나는 R과 R의 모든 패키지에 매우 익숙하다. ggplot2 문서를 보았지만 이것을 찾을 수 없었다. boxthis두 가지 요인 f1과 관련하여 변수의 상자 그림을 원합니다 f2. 즉, 모두를 가정이다 f1및 f2요인 …
13 r  boxplot  ggplot2 

4
백분율에 분산 분석을 사용하십니까?
독립 변수 (인자)로 4 개의 그룹 (4 BMI 그룹)이있는 테이블이 있습니다. 나는 "임신 중 어머니 흡연율"인 종속 변수를 가지고 있습니다. 이것을 위해 분산 분석을 사용할 수 있습니까? 아니면 카이 제곱 또는 다른 테스트를 사용해야합니까?
13 anova 

1
N-armed bandit 문제를 해결하기위한 최적의 알고리즘?
-greedy, softmax 및 UCB1과 같은 n-armed bandit 문제를 해결하기위한 많은 알고리즘에 대해 읽었지만 후회를 최소화하는 데 가장 적합한 방법을 정렬하는 데 문제가 있습니다.ϵϵ\epsilon n-armed bandit 문제를 해결하기 위해 알려진 최적의 알고리즘이 있습니까? 실제로 가장 성능이 좋은 것으로 보이는 알고리즘을 선택할 수 있습니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.