통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
R에서 중단 된 시계열 분석을위한 리소스
나는 R에 상당히 익숙하지 않다. 나는 시계열 분석을 읽으려고 시도했고 이미 끝났다. Shumway 및 Stoffer의 시계열 분석 및 해당 애플리케이션 3rd Edition , Hyndman의 우수한 예측 : 원칙과 실습 Avril Coghlan의 시계열 분석에 R 사용 A. Ian McLeod 외 R을 이용한 시계열 분석 Marcel Dettling 박사의 응용 시계열 분석 편집 …
12 r  time-series 

2
이차 프로그래밍으로 서포트 벡터 머신 최적화
선형 지원 벡터 머신 을 훈련시키는 프로세스를 이해하려고 합니다 . SMV의 속성을 통해 2 차 프로그래밍 솔버를 사용하는 것보다 훨씬 빠르게 최적화 할 수 있지만 학습을 위해 이것이 어떻게 작동하는지 알고 싶습니다. 훈련 데이터 set.seed(2015) df <- data.frame(X1=c(rnorm(5), rnorm(5)+5), X2=c(rnorm(5), rnorm(5)+3), Y=c(rep(1,5), rep(-1, 5))) df X1 X2 Y 1 -1.5454484 …
12 r  svm  optimization 

3
컨볼 루션 뉴럴 네트워크에서 최종 Softmax 레이어 이전의 비선형 성
나는 회선 신경망을 연구하고 구현하려고 노력하고 있지만이 질문이 일반적으로 다층 퍼셉트론에 적용되는 것으로 가정합니다. 내 네트워크의 출력 뉴런은 각 클래스의 활성화를 나타냅니다. 가장 활동적인 뉴런은 주어진 입력에 대해 예측 된 클래스에 해당합니다. 훈련에 대한 교차 엔트로피 비용을 고려하기 위해 네트워크의 끝에 softmax 레이어를 추가하여 각 뉴런의 활성화 값이 확률 값으로 …

3
glmnet을 사용하여 수축 (NAS) 방법으로 NA 값을 처리하는 방법
GWAS에서 올가미 회귀에 "glmnet"을 사용하고 있습니다. 일부 변형 및 개체에는 결 측값이 있으며 glmnet이 결 측값을 처리 할 수없는 것 같습니다. 이에 대한 해결책이 있습니까? 또는 올가미 회귀에서 누락 된 값을 처리 할 수있는 다른 패키지가 있습니까? 여기 내 스크립트가 있습니다. > library(glmnet) > geno6<-read.table("c6sigCnt.geno") > geno6[1:10,1:10] #genotype file (0,1,2 …

1
가우스 분포에서 MLE of Variance가 바이어스됨을 이해하는 방법은 무엇입니까?
PRML을 읽고 있는데 그림을 이해하지 못합니다. 그림을 이해하기위한 힌트와 가우시안 분포의 분산 MLE이 왜 편향 될 수 있습니까? 공식 1.55 : 공식 1.56 σ 2 M L E =1μ미디엄L E= 1엔∑n = 1엔엑스엔μ미디엄엘이자형=1엔∑엔=1엔엑스엔 \mu_{MLE}=\frac{1}{N} \sum_{n=1}^N x_n σ2미디엄L E= 1엔∑n = 1엔( x엔− μ미디엄L E)2σ미디엄엘이자형2=1엔∑엔=1엔(엑스엔−μ미디엄엘이자형)2 \sigma_{MLE}^2=\frac{1}{N}\sum_{n=1}^{N}(x_n-\mu_{MLE})^2

1
평균 평균 정밀도 vs 평균 역수
MAP을 사용하는 것이 적절한시기와 MRR을 사용해야하는시기를 이해하려고합니다. 이 프레젠테이션에서 MRR은 관련 결과 수가 5 개 미만일 때 가장 잘 활용되고 1 일 때 가장 잘 사용된다는 내용을 발견 했습니다. 다른 경우에는 MAP이 적합합니다. 두 가지 질문이 있습니다. 나는 이것이 왜 그런지 정말로 이해하지 못한다. 이 주장에 대한 인용 가능한 참고 …


3
존재하지 않거나 누락 된 데이터를 어떻게 처리합니까?
예측 방법을 시도했는데 내 방법이 올바른지 확인하고 싶습니다. 저의 연구는 다른 종류의 뮤추얼 펀드를 비교하고 있습니다. GCC 지수를 그중 하나의 벤치 마크로 사용하고 싶지만 문제는 2011 년 9 월에 GCC 지수가 중단되었고 2003 년 1 월부터 2014 년 7 월까지의 연구가 진행되었다는 것입니다. 따라서 다른 지수 인 MSCI 지수를 사용하려고했습니다. …

2
교차 검증을 사용하여 glmnet 패키지의 편차 측정에 대한 정확한 정의?
현재 reseach의 경우 이항 종속 변수에 대해 R의 glmnet 패키지를 통해 Lasso 방법을 사용하고 있습니다. glmnet에서 최적의 람다는 교차 검증을 통해 발견되며 결과 모델은 다양한 분류법 (예 : 오 분류 오류 또는 편차)과 비교할 수 있습니다. 내 질문 : 이탈은 glmnet에서 정확히 어떻게 정의됩니까? 어떻게 계산 되나요? (Friedman 등의 해당 …

3
코스 라 머신 러닝 코스 당 정규화 된 선형 회귀 비용 함수 도출
나는 몇 개월 전에 코스 트라를 통해 앤드류 응 (Andrew Ng)의 "머신 러닝 (Machine Learning)"과정을 수강했고, 대부분의 수학 / 유도에주의를 기울이지 않고 구현과 실용성에 중점을 두었습니다. 그 이후로 나는 기본 이론의 일부를 연구하기 시작했고 Ng 교수의 강의를 다시 방문했다. 나는 "Regularized Linear Regression"에 대한 강의를 읽고 그가 다음과 같은 비용 …


1
군집 분석에서 변수에 가중치를 할당
클러스터 분석에서 변수에 다른 가중치를 할당하고 싶지만 내 프로그램 (Stata)에 옵션이없는 것 같으므로 수동으로 수행해야합니다. 4 개의 변수 A, B, C, D를 상상해보십시오. 이러한 변수의 가중치는 w(A)=50% w(B)=25% w(C)=10% w(D)=15% 다음 두 가지 방법 중 하나가 실제로 트릭을 수행하는지 궁금합니다. 먼저 모든 변수를 표준화합니다 (예 : 범위별로). 그런 다음 각 …
12 clustering  stata 

3
매우 작은 세트의 이상치 탐지
12 개의 샘플 광도 값이 주어지면 주로 안정적인 광원의 밝기 값을 최대한 정확하게 얻어야합니다. 센서가 불완전하고 빛이 때때로 "깜박 거리며"밝거나 어두워 지므로 무시할 수 있습니다. 따라서 이상치 탐지가 필요합니다. 나는 다양한 접근 방식을 읽었으며 어떤 접근 방식을 결정할 수 없습니다. 특이 치의 수는 미리 알려져 있지 않으며 종종 0입니다. 플리커는 …

2
(이 분이 아닌) 명목 변수와 숫자 (간격) 또는 서수 변수 사이의 상관 계수
나는 이미이 사이트의 모든 페이지를 읽었고 내 문제에 대한 답을 찾으려고했지만 아무도 나에게 맞는 것 같지 않습니다 ... 먼저 내가 작업하는 데이터의 종류를 설명합니다 ... 300 명의 사용자마다 하나씩 여러 도시 이름을 가진 배열 벡터가 있다고 가정 해 봅시다. 또한 각 사용자의 설문 조사에 대한 점수 응답 또는 각 사용자의 …


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.