통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
스파 스 훈련 세트가 SVM에 부정적인 영향을 줍니까?
SVM을 사용하여 메시지를 다른 범주로 분류하려고합니다. 훈련 세트에서 원하는 단어 / 기호 목록을 작성했습니다. 메시지를 나타내는 각 벡터에 1대해 단어가 존재하면 해당 행을 설정합니다 . "corpus"는 다음과 같습니다. [mary, little, lamb, star, twinkle] 첫 번째 메시지 : "메리에게 작은 양이있었습니다"-> [1 1 0 0] 두 번째 메시지 : "twinkle little …

2
의미 적 의미를 유지하는 도메인에 구애받지 않는 기능 엔지니어링?
형상 공학은 종종 기계 학습에 중요한 구성 요소입니다 ( 2010 년 KDD 컵 우승에 크게 사용됨 ). 그러나 대부분의 기능 엔지니어링 기술은 기본 기능의 직관적 인 의미를 파괴하거나 특정 도메인 또는 특정 유형의 기능에 매우 구체적입니다. 전자의 전형적인 예는 주성분 분석입니다. 주제 관련 전문가가 해당 기능에 대해 알고있는 지식은 해당 …

2
DDoS 필터링을위한 머신 러닝 적용
에서 스탠포드의 기계 학습 코스 앤드류 응은 IT에 ML을 적용 언급했다. 얼마 후 우리 사이트에서 적당한 크기 (약 20k 봇)의 DDoS를 얻었을 때 나는 간단한 신경망 분류기를 사용하여 그것에 맞서 싸우기로 결정했습니다. 나는이 파이썬 스크립트를 약 30 분 안에 작성했습니다 : https://github.com/SaveTheRbtz/junk/tree/master/neural_networks_vs_ddos 그것은 pyBrain을 사용 하고 3 개의 nginx 로그를 …

2
적응 형 순차 분석을위한 p- 값 조정 (카이 제곱 테스트)?
다음 문제와 관련된 통계 문헌이 무엇인지, 그리고 해결 방법에 대한 아이디어를 알고 싶습니다. 다음과 같은 문제를 상상해보십시오. 일부 질병에는 4 가지 치료법이 있습니다. 어떤 치료가 더 나은지 확인하기 위해 특별한 시험을 수행합니다. 시험에서 우리는 과목이없는 것으로 시작한 다음, 더 많은 과목이 시험에 참여합니다. 각 환자는 4 가지 가능한 치료 중 …


2
여러 대상 또는 클래스를 예측 하시겠습니까?
여러 이벤트를 예측하려고하는 예측 모델을 구축한다고 가정합니다 (예 : 주사위 굴림과 동전 던지기). 내가 익숙한 대부분의 알고리즘은 하나의 대상에서만 작동하므로 이런 종류의 표준 접근 방식이 있는지 궁금합니다. 가능한 두 가지 옵션이 있습니다. 아마도 가장 순진한 접근 방식은 단순히 두 가지 다른 문제로 처리 한 다음 결과를 결합하는 것입니다. 그러나 두 …


2
SVM, 가변 상호 작용 및 교육 데이터 적합
나는 두 가지 일반적인 / 더 이론적 인 질문이 있습니다. 1) 예측 모델을 작성할 때 SVM이 변수 상호 작용을 처리하는 방법이 궁금합니다. 예를 들어, f1과 f2의 두 가지 기능이 있고 목표가 f1, f2에 의존하고 f1 * f2 (또는 일부 함수 h (f1, f2))라고 말하면 SVM이 적합합니까 (OOS뿐만 아니라 훈련 데이터에도) …

1
Brier 점수와 유사한 평균 절대 오차의 이름은 무엇입니까?
어제의 질문 사건 확률을 추정하는 모델의 정확성을 결정 하여 확률 점수에 대해 궁금해했습니다. 찔레 점수 이고 평균 제곱 오차 측정. 유사한 평균 절대 오차 성능 측정이 이름도 있니?1N∑i=1N(predictioni−referencei)21N∑i=1N(predictioni−referencei)2\frac{1}{N}\sum\limits _{i=1}^{N}(prediction_i - reference_i)^2 1N∑i=1N|predictioni−referencei|1N∑i=1N|predictioni−referencei|\frac{1}{N}\sum\limits _{i=1}^{N}|prediction_i - reference_i|

1
사건 확률을 추정하는 모형의 정확성 결정
두 가지 결과 a와 b로 이벤트를 모델링하고 있습니다. a 또는 b가 발생할 확률을 추정하는 모델을 만들었습니다 (예 : 모델이 a가 40 % 확률로 발생하고 b가 60 % 확률로 발생한다고 계산합니다). 모델의 추정치에 대한 시행 결과에 대한 큰 기록이 있습니다. 모델이이 데이터를 얼마나 정확하게 사용하고 있는지 정량화하고 싶습니다. 이것이 가능합니까? 그렇다면 …

2
R의 RFM 및 고객 평생 가치 모델링
R에서 최근 성, 빈도 및 금전적 가치 (RFM) 모델링 및 고객 가치 모델링을 수행하는 방법을 아는 사람이 있습니까? 또한 누군가 나에게 그것에 대한 몇 가지 문헌을 언급 할 수 있습니까?

3
다단계 모델링을위한 예시적인 데이터 세트 및 분석
최근에는 다단계 모델링에 대한 입문 과정을 수강했습니다. 우리가 사용한 대부분의 데이터 세트와 예제는 사회 과학에서 얻은 것입니다. 나는 생물 통계학과에서 2 주 인턴쉽을 얻었습니다. 병원 간 및 5 년 이상 사망률이 높은 응급 상황에서 환자 결과의 병원 수준 변화에 관한 프로젝트를 시작하기를 원합니다. 시간 범위. 나는 다음 주에 인턴쉽을 시작하고 …

3
연속 분포에서 샘플링 된 데이터 모드 계산
연속 분포에서 샘플링 된 데이터의 '모드'를 맞추는 가장 좋은 방법은 무엇입니까? 연속 분포에 대해 기술적으로 정의되지 않은 모드가 맞기 때문에 ( '정확한가?') 실제로 '가장 일반적인 가치를 어떻게 찾습니까?'를 묻습니다. 부모 분포가 가우스 인 것으로 가정하면 데이터를 비닝하고 모드가 가장 많은 개수의 빈 위치임을 알 수 있습니다. 그러나 빈 크기를 어떻게 …


2
짝을 이루지 않은 t- 검정에 어떤 정규성 가정이 필요합니까? 그리고 그들은 언제 만납니 까?
쌍을 이루는 t- 검정을 수행 하려면 일치하는 측정 단위 간의 평균 차이가 정상적으로 분포되어야합니다. 쌍을 이루는 t- 검정에서, 이는 일치하는 측정 단위 사이의 차이가 정상적으로 분포 될 것을 요구하면서 (AFAIK) 분명히 표현됩니다 (두 비교 그룹 각각의 분포가 정상이 아닌 경우에도). 그러나 쌍을 이루지 않은 t- 검정에서는 일치하는 단위 간의 차이에 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.