통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
R의 분류 모델에 대한 증분 학습
아래 코드를 사용하여 사기 탐지를위한 분류 자 (결정 트리, 임의 포리스트, 로지스틱 회귀 등과 같은 표준 분류 자 ​​중 하나 일 수 있음) 가 있다고 가정합니다 . library(randomForest) rfFit = randomForest(Y ~ ., data = myData, ntree = 400) # A very basic classifier Say, Y is a binary outcome …

2
개별 레벨 패널 데이터와의 차이의 차이
개별 레벨 패널 데이터로 차이 모델의 차이를 지정하는 올바른 방법은 무엇입니까? 설정은 다음과 같습니다. 여러 해 동안 도시에 개별 수준의 패널 데이터가 포함되어 있으며 처리는 도시 수준에 따라 다르다고 가정하십시오. 공식적으로하자 개인에 대한 결과가 될 나는 도시 의 연도 t 와 D 의 t 에 대한 더미가 될 개입의 영향을 …

2
3 차원의 다중 선형 회귀 분석이 가장 적합한 평면이거나 가장 적합한 선입니까?
우리의 교수진은 다중 선형 회귀의 수학이나 기하학적 표현에 들어 가지 않으며 약간 혼란 스럽습니다. 한편으로는 더 높은 차원에서도 여전히 다중 선형 회귀 라고 합니다. 다른 한편으로, 예를 들어 있고 및 대해 원하는 값을 꽂을 수 있다면 가능한 해결책을 얻을 수 없습니다. 라인이 아닌?X1X2와이^= b0+ b1엑스1+ b2엑스2Y^=b0+b1X1+b2X2\hat{Y} = b_0 + b_1 …

1
TBATS 모델 결과 및 모델 진단을 해석하는 방법
나는 매시간 30 분의 수요 데이터를 얻었습니다. 이는 다중 계절 시계입니다. R의 패키지에서 사용 tbats했으며 forecast다음과 같은 결과를 얻었습니다. TBATS(1, {5,4}, 0.838, {<48,6>, <336,6>, <17520,5>}) 시리즈가 Box-Cox 변환을 반드시 사용해야하는 것은 아니며 오류 항은 ARMA (5, 4)이며 계절성을 설명하기 위해 6, 6 및 5 항이 사용됩니까? 감쇠 매개 변수 0.8383은 …

2
종단 데이터를위한 머신 러닝 기술
종단 데이터 모델링을위한 머신 러닝 기술 (비 관리)이 있는지 궁금합니다. 저는 항상 혼합 효과 모델 (주로 비선형)을 사용했지만 다른 방법 (기계 학습 사용)이 있는지 궁금합니다. 머신 러닝이란 랜덤 임산, 분류 / 클러스터링, 의사 결정 트리, 심지어 딥 러닝 등을 의미합니다.

1
언제 모델 찾기를 중단해야합니까?
나는 에너지의 주가와 날씨 사이의 모델을 찾고 있습니다. 유럽 ​​국가간에 구매 한 MWatt의 가격과 날씨에 대한 많은 가치가 있습니다 (Grib 파일). 각 시간은 5 년 (2011-2015)입니다. 가격 / 일 이것은 1 년 동안 하루입니다. 나는 5 년에 시간당이 있습니다. 날씨의 예 1 시간 동안 켈빈 단위의 3Dscatterplot. 시간당 데이터 당 …

4
ML 자체가 아닌 응용 기계 학습에 대해 배울 수있는 좋은 예 / 책 / 자료
ML 과정을 이미 수강했지만 지금은 직장에서 ML 관련 프로젝트를 진행하고 있기 때문에 실제로 적용하기 위해 많은 노력을 기울이고 있습니다. 나는 내가하고있는 일이 이전에 연구 / 다루어졌지만 확실하지는 않지만 특정 주제를 찾을 수는 없습니다. 온라인에서 찾은 모든 머신 러닝 예제는 매우 간단합니다 (예 : Python에서 KMeans 모델을 사용하고 예측을 보는 방법). …

1
배치 정규화를주의해서 수행해야하는 예에 대한 설명은 무엇입니까?
나는 배치 정규화 논문 을 읽고 있었으며 [1] 예제를 통해 하나의 섹션이 있는데, 왜 정규화가 신중하게 수행되어야하는지 보여 주려고 노력했다. 솔직히, 예제가 어떻게 작동하는지 이해할 수 없으며 가능한 한 종이를 이해하는 것이 정말 궁금합니다. 먼저 여기에 인용하겠습니다. 예를 들어, 입력이있는 층을 고려 U 학습 바이어스 (B)를 추가하고, 트레이닝 데이터를 통해 …

2
복잡한 측량 데이터에서 LASSO 이후 교차 검증
지속적인 결과와 함께 LASSO를 사용하는 일부 후보 예측 변수에서 모델 선택을 시도하고 있습니다. 목표는 LASSO로부터 튜닝 파라미터의 솔루션 경로를 얻은 후에 K- 폴드 교차 검증에 의해 수행 될 수있는 최고의 예측 성능을 갖는 최적 모델을 선택하는 것이다. 여기서 문제는 데이터가 군집 샘플링 및 계층화가있는 복잡한 다단계 조사 설계 (NHANES)에서 나온다는 …

2
잔류 네트워크는 그라디언트 부스팅과 관련이 있습니까?
최근에, 우리는 Residual Neural Net의 출현을 보았습니다. 여기서 각 레이어는 계산 모듈 와 i 번째 레이어의 출력과 같이 레이어에 대한 입력을 유지하는 바로 가기 연결 로 구성됩니다 . 네트워크는 잔존 피처를 추출 할 수 있으며 깊이가 더 깊어지면서 배니싱 그라디언트 문제에 대해보다 강력한 성능을 제공하여 최첨단 성능을 달성합니다.y i + …

4
신경망-가중치의 의미
피드 포워드 NN을 사용하고 있습니다. 나는 개념을 이해하지만 내 질문은 무게에 관한 것입니다. 그것들을 어떻게 해석 할 수 있습니까, 즉 그것들이 무엇을 나타내거나 어떻게 파괴하지 않을 수 있습니까 (함수 계수에 의해서만)? 나는 "무게의 공간"이라는 것을 찾았지만 그것이 무엇을 의미하는지 잘 모르겠습니다.

2
R의 모델 평균 결과 해석
R의 모델 평균을 사용하여 일부 데이터를 분석 한 결과를 이해하고 이해하려고합니다. 주어진 변수에 대한 측정 방법의 효과를 분석하기 위해 다음 스크립트를 사용하고 있습니다. 데이터 세트는 다음과 같습니다. https://www.dropbox.com/s/u9un273gzw9o30u/VMT4.csv?dl=0 장착 할 모델 : LM.1 <- gls(VMTf ~ turn+sex+method, na.action="na.fail", method = "ML",VMT4) 준설 풀 모델 require(MuMIn) d=dredge(LM.1) print(d) coefficients(d) 모수 추정값을 …

3
가우스 프로세스 모델의 주요 장점
가우스 프로세스는 특히 에뮬레이션에서 널리 사용되었습니다. 계산 요구가 높다는 것이 알려져있다 ( ).0(n3)0(n3)0(n^3) 무엇이 인기가 있습니까? 그들의 주요 장점과 숨겨진 장점은 무엇입니까? 왜 파라 메트릭 모델 대신에 그것들이 사용 되는가? (파라 메트릭 모델 I에 의해 입력 파라메터와 출력 트렌드를 설명하기 위해 다른 파라 메트릭 형태를 사용할 수있는 전형적인 선형 회귀를 …

1
scikit-learn Python의 ElasticNet과 R의 Glmnet의 차이점
ElasticNetPython과 glmnetR의 동일한 데이터 세트 에서 scikit-learn을 사용하여 Elastic Net 모델을 피팅 하면 동일한 산술 결과가 생성 되는지 여부를 확인하려고 한 사람이 있습니까? 나는 두 가지 함수가 인수에 전달하는 기본값이 다르기 때문에 많은 매개 변수 조합을 실험하고 데이터를 스케일링했지만 두 언어간에 동일한 모델을 생성하는 것으로 보이지는 않습니다. 아무도 같은 문제에 …

1
제로 팽창 된 포아송 또는 제로 팽창 된 음 이항에 대한 "이탈"측정?
D = 2 * (포화 모델의 로그 우도에서 적합 모델의 로그 우도)로 정의 된 축척 편차는 종종 GLM 모델에서 적합도의 척도로 사용됩니다. 설명 된 이탈률은 [D (null model)-D (fitted model)] / D (null model)로 정의되며 선형 회귀의 R- 제곱에 대한 GLM 아날로그로도 사용됩니다. ZIP 및 ZINB 분포가 지수 분포의 일부가 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.