통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
2 차 차분의 직관은 무엇입니까?
때로는 고정식으로 만들기 위해 시리가 달라져야 할 수도 있습니다. 그러나 1 차 차분이 충분하지 않을 때 2 차 차분이 어떻게 고정 될 수 있는지 이해할 수 없습니다. 2 차 차분과 필요한 경우에 대해 직관적으로 설명해 주시겠습니까?

2
컨볼 루션 레이어의 여러 필터가 훈련 중에 동일한 매개 변수를 배우지 않습니까?
내가 배운 내용을 바탕으로 CNN의 Conv Layer에서 여러 필터를 사용하여 다양한 기능 탐지기를 학습합니다. 그러나 이러한 필터는 비슷하게 적용되므로 (즉, 입력 영역에 슬라이드 및 곱하기) 훈련 중에 동일한 매개 변수를 배우지 않습니까? 따라서 여러 필터를 사용하는 것이 중복됩니까?

1
R의 각 예측에 대해 회귀에서 신뢰 점수 (임의의 포리스트 / XGBoost 포함)를 계산하는 방법은 무엇입니까?
Random Forests 또는 Extreme Gradient Boosting (XGBoost)과 같은 알고리즘을 사용할 때 각 예측 값에 대한 신뢰 점수를 얻는 방법이 있습니까? 이 신뢰 점수의 범위는 0에서 1까지이며 특정 예측에 대해 내가 얼마나 확신하는지 보여 줍니다 . 인터넷에서 신뢰에 대해 찾은 것에서 일반적으로 간격으로 측정됩니다. 다음은 라이브러리의 confpred함수를 사용하여 계산 된 신뢰 …

3
one-hot 인코딩과 더미 인코딩의 문제
k 레벨의 범주 변수가 더미 인코딩에서 k-1 변수로 인코딩되어야한다는 사실을 알고 있습니다 (다중 값 범주 변수의 경우와 유사). 다른 회귀 방법, 주로 선형 회귀, 페널티 선형 회귀 (Lasso, Ridge, ElasticNet), 트리 기반 (임의 포리스트) , 그래디언트 부스팅 머신). 선형 회귀에서 다중 공선 성 문제가 발생한다는 것을 알고 있습니다 (실제로 아무런 …


2
부트 스트랩의 장단점
부트 스트랩 개념에 대해 방금 배웠으며, 데이터의 많은 부트 스트랩 샘플을 항상 생성 할 수 있다면 더 많은 "실제"데이터를 얻는 것이 귀찮은 이유는 무엇입니까? 설명이 있다고 생각합니다. 정확한지 알려주십시오. 부트 스트래핑 프로세스는 분산을 줄인다고 생각합니다.하지만 원래 데이터 세트가 BIASED 인 경우 복제본의 수에 관계없이 낮은 분산과 높은 바이어스에 갇힌 것보다 …

3
CIFAR-10 Tensorflow 백엔드가있는 Keras가 60 % 이상의 정확도를 달성 할 수 없음
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 작년에 문을 닫았 습니다 . CIFAR-10 데이터 세트에서 15 에포크 이후 훈련은 유효성 검사 손실이 더 이상 감소하지 않는 것으로 보이며 1.4 (60 % 유효성 검사 정확도)로 고정됩니다. …

2
비열 등성 테스트에서 널을 받아 들일 수 있습니까?
일반적인 가설 검정 방법을 사용하여 일반적인 t- 검정 방법에서는 null을 거부하거나 null을 거부하지 않지만 null을 허용하지 않습니다. 이에 대한 한 가지 이유는 더 많은 증거를 얻을 경우 동일한 효과 크기가 중요해지기 때문입니다. 그러나 비열 등성 테스트는 어떻게됩니까? 그건: H0:μ1−μ0≤ xH0:μ1−μ0≤xH_0: \mu_1 - \mu_0 \le x vs. H1:μ1−μ0> xH1:μ1−μ0>xH_1: \mu_1 - …

1
Random Forest 회귀 또는 분류자를 선택해야합니까?
임의 포리스트에 의해 이진 대상 클래스가있는 데이터 집합을 맞습니다. 파이썬에서는 randomforestclassifier 또는 randomforestregressor로 할 수 있습니다. randomforestclassifier에서 직접 분류를 가져 오거나 randomforestregressor를 먼저 실행하고 예상 점수 세트 (연속 값)를 다시 가져올 수 있습니다. 그런 다음 점수 세트에서 예측 된 클래스를 도출하기위한 컷오프 값을 찾을 수 있습니다. 두 방법 모두 동일한 …

3
AR (1) 계수의 OLS 추정기가 바이어스되는 이유는 무엇입니까?
OLS가 AR (1) 프로세스의 바이어스 추정기를 제공하는 이유를 이해하려고합니다. 고려 이 모델에서는 엄격한 외 생성이 위반됩니다. 즉, 와 는 상관되지만 과 는 상관되지 않습니다. 그러나 이것이 사실이라면 왜 다음과 같은 간단한 파생이 이루어지지 않습니까? 와이티ϵ티= α + β와이t - 1+ϵ티,∼I I D엔( 0 , 1 ) .yt=α+βyt−1+ϵt,ϵt∼iidN(0,1). \begin{aligned} y_{t} &= …

4
AUC는 각 클래스에서 무작위로 선택된 인스턴스를 올바르게 분류 할 가능성이 있습니까?
나는이 자막을 종이로 읽었고 AUC가 다른 곳에서는 이런 식으로 묘사 된 것을 본 적이 없다. 이것이 사실입니까? 이것을 볼 수있는 증거 또는 간단한 방법이 있습니까? 그림 2는 수신기 작동 특성 곡선 (AUC) 아래 영역으로 표현 된 이분법 변수의 예측 정확도를 보여줍니다. 이는 각 등급에서 무작위로 선택된 두 명의 사용자 (예 …

3
Holt-Winters 또는 ARIMA를 사용하십니까?
내 질문은 Holt-Winters와 ARIMA의 개념적 차이에 관한 것입니다. 내가 이해하는 한 Holt-Winters는 ARIMA의 특별한 경우입니다. 그러나 한 알고리즘이 언제 다른 알고리즘보다 선호됩니까? 아마도 Holt-Winters는 점증 적이므로 인라인 (빠른) 알고리즘의 역할을합니까? 통찰력을 기대합니다.

3
단계적 회귀의 장점은 무엇입니까?
나는 문제에 대한 접근 방식의 다양성을 위해 단계적 회귀를 실험하고 있습니다. 그래서 두 가지 질문이 있습니다. 단계적 회귀의 장점은 무엇입니까? 구체적인 강점은 무엇입니까? 단계적 회귀를 사용하여 피처를 선택한 다음 선택한 모든 피처를 함께 가져 오는 규칙적인 회귀를 적용하는 하이브리드 접근 방식에 대해 어떻게 생각하십니까?

2
LSTM을 사용하여 언어 모델링 작업에서 알 수없는 단어 처리
자연어 처리 (NLP) 작업의 경우 단어에 대한 포함으로 word2vec 벡터 를 종종 사용합니다 . 그러나, 단어 2vec 벡터에 의해 포착되지 않는 많은 알 수없는 단어가있을 수 있습니다. 단순히이 단어가 훈련 데이터에서 자주 보이지 않기 때문입니다 (많은 구현에서는 단어를 단어에 추가하기 전에 최소 개수를 사용합니다). 특히 단어의 철자가 틀린 Twitter와 같은 …


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.