통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
R에서 음이 아닌 올가미 구현
사용할 수있는 오픈 소스 또는 기존 라이브러리를 찾고 있습니다. 내가 말한 한 glmnet 패키지는 음이 아닌 경우를 다루기 위해 쉽게 확장 할 수 없습니다. 나는 틀릴지도 모른다, 어떤 아이디어를 가진 사람은 대단히 감사합니다. 음이 아닌 것은 모든 계수가 양수 (> 0)로 제한됨을 의미합니다.
13 r  lasso 

4
Arima 전 또는 Arima 내의 차이 시계열
Arima를 사용하기 전에 계열을 변경하는 것이 더 좋습니까 (또는 필요하다고 가정) Arima 내에서 d 매개 변수를 사용하는 것이 더 낫습니까? 동일한 모델과 데이터로 어떤 경로를 취했는지에 따라 피팅 값이 어떻게 다른지 놀랐습니다. 아니면 내가 잘못하고 있습니까? install.packages("forecast") library(forecast) wineindT<-window(wineind, start=c(1987,1), end=c(1994,8)) wineindT_diff <-diff(wineindT) #coefficients and other measures are similar modA<-Arima(wineindT,order=c(1,1,0)) …
13 r  time-series  arima 

3
변수를 버리지 않고 높은 다중 공선 성을 갖는 선형 회귀 분석에서 불안정한 추정값을 어떻게 처리 할 수 있습니까?
다중 공선 성이 높은 선형 회귀 분석의 베타 안정성? 선형 회귀 분석에서 변수 및 는 높은 다중 공선 성을 가지고 있습니다 (상관 관계는 약 0.9입니다).x 2엑스1x1x_1엑스2x2x_2 우리는 계수 안정성 에 대해 염려 하므로 다중 공선 성을 처리해야합니다.ββ\beta 교과서 솔루션은 변수 중 하나를 버리는 것입니다. 그러나 우리는 단순히 변수를 버림으로써 유용한 …

4
두 표본의 평균이 크게 다르지만 차이가 너무 작아서 중요하지 않은 경우 수행 할 작업
두 개의 샘플이 있습니다 ( 두 경우 모두 ). 평균적으로 풀링 된 표준의 두 배가 다릅니다. dev. 결과 값은 약 10입니다. 평균이 같지 않다는 것을 결정적으로 보여 주 었음을 아는 것이 좋지만, 이것은 큰 n에 의해 구동되는 것 같습니다. 데이터의 히스토그램을 보면 작은 p- 값과 같은 것이 실제로 데이터를 대표한다고 …

2
두 개의 다변량 분포가 동일한 기본 모집단에서 표본 추출되는지 여부를 어떻게 테스트합니까?
두 개의 다변량 데이터 세트가 제공되고 이전과 새 데이터 세트가 있으며 동일한 프로세스 (모델이 없음)로 생성되었지만 아마도 수집 / 생성 라인을 따라 어딘가에 있다고 가정하십시오. 데이터에 문제가 생겼습니다. 예를 들어 기존 데이터에 대한 유효성 검사 세트 또는 기존 데이터에 추가 할 때 새 데이터를 사용하고 싶지 않을 것입니다. Wilcoxon 순위 …


2
상호 작용 모델에서 최상의 기능 찾기
기능 값이있는 단백질 목록이 있습니다. 샘플 테이블은 다음과 같습니다. ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 행은 단백질이고 열은 기능입니다. 또한 상호 작용하는 단백질 목록도 있습니다. 예를 들어 Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 문제점 : 예비 분석을 위해 어떤 기능이 단백질 상호 작용에 가장 큰 영향을 미치는지 알고 싶습니다. 내 이해는 …

1
을 제곱 하면 왜 분산이 설명됩니까?
이것은 기본적인 질문 일지 모르지만 회귀 모델 의 값을 단순히 제곱하여 설명 된 분산의 그림을 줄 수있는 이유가 궁금합니다 .RRR 나는 계수가 관계의 힘을 줄 수 있다는 것을 이해 하지만,이 값을 단순히 제곱하는 것이 설명 된 분산의 척도를 어떻게 제공하는지 이해하지 못합니다.RRR 이것에 대한 쉬운 설명이 있습니까? 도와 주셔서 감사합니다!

2
계층 적 로지스틱 회귀 분석에 Bernoulli 매개 변수에 베타 분포를 사용하는 이유는 무엇입니까?
저는 현재 Kruschke의 "Doing Bayesian Data Analysis"책을 읽고 있습니다. 그러나 계층 적 로지스틱 회귀 (20 장) 장은 다소 혼란 스럽다. 그림 20.2는 Bernoulli 매개 변수가 S 자형 함수를 통해 변환 된 계수에 대한 선형 함수로 정의되는 계층 적 로지스틱 회귀 분석을 설명합니다. 이것은 다른 소스에서도 온라인에서 본 대부분의 예에서 계층 …

2
e1071 libsvm에 문제가 있습니까?
두 개의 겹치는 클래스, 각 클래스의 7 점, 2 차원 공간에있는 데이터 세트가 있습니다. R에서는 패키지 svm에서 실행 e1071하여 이러한 클래스에 대한 분리 초평면을 작성합니다. 다음 명령을 사용하고 있습니다. svm(x, y, scale = FALSE, type = 'C-classification', kernel = 'linear', cost = 50000) 여기서 x내 데이터 요소와 y레이블이 포함되어 있습니다. …

1
할턴 시퀀스 대 소볼 시퀀스?
이전 질문 의 답변에서 나는 균일 한 샘플 공간을 상당히 균일하게 덮는 일련의 벡터를 만들기 위해 Halton 시퀀스를 지향했습니다. 그러나 위키 백과 페이지 는 높은 소수가 특히 시리즈 초반에 높은 상관 관계가 있다고 언급합니다. 상대적으로 샘플 크기가 짧은 모든 소수 쌍의 경우에 해당합니다. 변수가 상관 관계가 없어도 샘플 공간이 균등하게 …

2
신경망에서 파생 된 기능이 사용되는 이유는 무엇입니까?
예를 들어, 주택 가격을 예측하고 집의 길이와 너비에 대한 두 가지 입력 기능이 있습니다. 때로는 길이 * 너비 인 면적과 같은 '유도 된'다항식 입력 기능도 포함됩니다. 1) 파생 기능을 포함시키는 요점은 무엇입니까? 신경망이 훈련 중에 길이, 너비 및 가격 간의 연결을 배우지 않아야합니까? 왜 세 번째 기능인 영역이 중복되지 않습니까? …


2
Quantile 회귀 예측
일부 모델에 Quantile Regression을 사용하는 데 관심이 있지만이 방법을 사용하여 달성 할 수있는 사항에 대해 설명하고 싶습니다. 나는 특히 특이 치와 이분산성에 직면했을 때 IV / DV 관계에 대한보다 강력한 분석을 얻을 수 있지만 내 경우에는 예측에 중점을 둔다는 것을 이해합니다. 특히 더 복잡한 비선형 모델이나 부분 선형 회귀에 의존하지 …

5
표본이 센서스보다 더 정확하다고 주장하는 이유는 무엇입니까?
샘플링 과정을 배울 때 다음 두 가지 진술을 충족시킵니다. 1) 샘플링 오류는 대부분 가변성, 비 샘플링 오류는 편차를 유발합니다. 2) 비 샘플링 오차로 인해 샘플이 종종 CENSUS보다 정확합니다. 나는이 두 진술을 이해하는 방법을 모른다. 이 두 문장을 얻는 기본 논리는 무엇입니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.