통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
심층 신경망에서의 민감도 분석
이미 한 질문 ( One-Layer 피드 포워드 네트워크에서 가중치 중요성 추출 )에 따라 신경망에서 입력의 관련성에 대한 추론을 찾고 있습니다. 관심있는 출력 노드에서 레이어를 통해 뒤로 이동하여 입력 중요도를 재구성하는 것이 어렵거나 시간이 많이 걸리는 딥 넷을 고려할 때 신경망에 대한 감도 분석을 수행하는 데 이론적 프레임 워크가 있는지 궁금해했습니다. …

1
NumPy는 불충분 한 시스템의 최소 제곱을 어떻게 해결합니까?
X 모양 (2, 5) 와 y 모양 (2,) 가 있다고 가정 해 봅시다. 이것은 작동합니다 : np.linalg.lstsq(X, y) X가 모양 (N, 5) 인 경우에만 이것이 작동 할 것으로 예상합니다. N> = 5 그러나 왜 그리고 어떻게? 예상대로 5 개의 가중치를 다시 얻지 만이 문제는 어떻게 해결됩니까? 우리가 2 개의 방정식과 …

1
AIC를 기준으로 모델을 비교하는 방법은 무엇입니까?
우리는 로그 우도를 계산하기 위해 동일한 방법을 사용하는 두 가지 모델을 가지고 있으며 하나의 AIC는 다른 것보다 낮습니다. 그러나 AIC가 낮은 것은 해석하기가 훨씬 어렵습니다. 어려움을 도입 할 가치가 있는지 판단하는 데 어려움을 겪고 있으며 AIC의 백분율 차이를 사용하여이를 판단했습니다. 우리는 두 AIC 사이의 차이가 0.7 %에 불과하다는 것을 발견했으며, …

3
가설 검정에 높은 양의 첨도가 문제가되는 이유는 무엇입니까?
나는 잔차의 긍정적 인 첨도가 정확한 가설 검정과 신뢰 구간 (따라서 통계적 추론에 문제가 있음)에 문제가 될 수 있다고 들었습니다 (죄송합니다. 이것이 사실입니까? 그렇다면 그 이유는 무엇입니까? 높은 양의 첨도 잔차가 잔차의 대부분이 잔차 평균 0에 가까워서 잔차가 적다는 것을 나타내지 않습니까? (답이 있다면 수학적으로 크게 기울이지 않았으므로 깊이있는 수학을 …


3
로지스틱 회귀 분석에서 WoE (증거의 무게)로 변수 바꾸기
이것은 내 동료들과 함께 연습이나 방법에 관한 질문입니다. 로지스틱 회귀 모델을 만드는 동안 사람들이 범주 형 변수 (또는 비닝되는 연속 형 변수)를 각각의 증거 가중치 (WoE)로 대체하는 것을 보았습니다. 이것은 회귀 변수와 종속 변수 사이의 단조로운 관계 를 설정하기 위해 수행됩니다 . 내가 이해하는 한 모델이 만들어지면 방정식의 변수는 데이터 …

4
지연이있는 다중 선형 회귀와 시계열의 "기계적"차이는 무엇입니까?
저는 현재 데이터 공학 석사 학위를 공부하고있는 비즈니스 및 경제학을 전공했습니다. 선형 회귀 (LR)와 시계열 분석 (TS)을 공부하면서 질문이 떠 올랐습니다. 여러 선형 회귀를 사용하고 지연된 변수를 추가하는 대신 (ACF 및 PACF를 사용하여 지연된 순서로) 완전히 새로운 방법, 즉 시계열 (ARIMA)을 만드는 이유는 무엇입니까? 그래서 선생님은이 문제에 대한 작은 에세이를 …

1
베이지안 올가미 및 스파이크 및 슬래브
질문 : 변수 선택을 위해 하나를 사용하는 것의 장점 / 단점은 무엇입니까? I는 가능성이 있다고 가정 I를 넣을 수 어느 사도 중 하나 : 또는 y∼N(Xw,σ2I)y∼N(Xw,σ2I)y\sim\mathcal{N}(Xw,\sigma^2I)wi∼πδ0+(1−π)N(0,100)π=0.9,wi∼πδ0+(1−π)N(0,100)π=0.9, w_i\sim \pi\delta_0+(1-\pi)\mathcal{N}(0,100)\\ \pi=0.9\,, wi∼exp(−λ|wi|)λ∼Γ(1,1).wi∼exp⁡(−λ|wi|)λ∼Γ(1,1). w_i\sim \exp(-\lambda|w_i|)\\ \lambda \sim \Gamma(1,1)\,. 나는 '정규화'매개 변수를 선택 하기 위해 대부분의 가중치가 0이고 이전의 감마를 강조하기 위해 를 넣었습니다 …


3
신경망-이진 대 이산 / 연속 입력
모든 입력 노드 (역 전파 유무에 관계없이)의 피드 포워드 네트워크에 대한 입력 으로 이산 값 또는 연속 정규화 값 (예 : (1; 3)) 보다 이진 값 (0/1)을 선호해야하는 이유가 있습니까? 물론, 나는 어느 형태로든 변환 될 수있는 입력에 대해서만 이야기하고 있습니다. 예를 들어, 여러 값을 취할 수있는 변수가있는 경우 하나의 …

4
기능 스케일링 및 평균 정규화
Andrew Ng의 기계 학습 과정을 수강하고 여러 번 시도한 후에도이 질문에 대한 답변을 얻을 수 없었습니다. 레벨을 통과했지만이 문제를 해결하는 데 도움이됩니다. 명의 학생들이 일부 수업을 받았고 수업에 중간 시험과 최종 시험이 있다고 가정 합니다. 두 시험에서 점수 데이터 세트를 수집했으며 다음과 같습니다.m = 4m=4m=4 midterm (midterm)^2 final 89 7921 …


4
왜“잔여 표준 오류”라고 말합니까?
표준 오차는 추정 된 표준 편차이고 σ ( θ ) 추정기에서의 θ 파라미터에 대한 θ .σ^( θ^)σ^(θ^)\hat \sigma(\hat\theta)θ^θ^\hat\thetaθθ\theta 잔차의 추정 표준 편차가 "잔차 표준 오차"(예 : R의 summary.lm함수 출력 )라고하고 잔차 표준 편차가 아닌 이유는 무엇입니까? 여기에 표준 오차를 갖는 모수 추정치는 무엇입니까? 각 잔차를 "그"오류 항에 대한 추정기로 간주하고 …

2
왜 제곱 차이가 일반적으로 사용됩니까?
새로운 통계적 방법과 개념을 조사 할 때, 나는 종종 제곱 차이 (또는 평균 제곱 오차 또는 수많은 다른 상피)에 부딪칩니다. 예를 들어, Pearson의 r은 점이 놓인 회귀선과의 평균 제곱 차를 기준으로 결정됩니다. 분산 분석의 경우 제곱의 합 등을보고 있습니다. 이제 모든 것을 제곱함으로써 특이 치가있는 데이터가 실제로 불이익을 받는다는 것을 …

4
ROC 곡선을 해석하는 방법?
SAS의 데이터에 로지스틱 회귀를 적용했으며 여기에 ROC 곡선 및 분류 표가 있습니다. 나는 분류 표의 수치에 익숙하지만 roc 곡선과 그 아래 영역이 무엇을 나타내는 지 정확히 알지 못합니다. 모든 설명은 크게 감사하겠습니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.