통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

5
여러 회귀 분석을 사용하여 여러 다른 PC에서 하나의 주성분 (PC)을 예측할 수 있습니까?
얼마 전 R-help 메일 링리스트의 사용자가 회귀에서 PCA 점수를 사용하는 건전성에 대해 물었습니다. 사용자는 일부 PC 점수를 사용하여 다른 PC의 변형을 설명하려고합니다 (자세한 내용은 여기 참조 ). 대답은 아니요, PC가 서로 직교하기 때문에 소리가 들리지 않는다는 것입니다. 누군가 이것이 왜 더 자세하게 설명 할 수 있습니까?
15 regression  pca 

5
왜 미국과 영국 학교가 표준 편차를 계산하는 다른 방법을 가르치는가?
영국 학교에서 이해하는 것처럼 표준 편차는 다음을 사용하여 찾을 수 있습니다. 반면 미국 학교는 다음과 같이 가르칩니다. (어쨌든 기본 수준에서). 이것은 인터넷에서 검색 할 때 과거에 많은 학생들의 문제를 일으켰지 만 잘못된 설명을 찾았습니다. 왜 차이점이 있습니까? 간단한 데이터 세트에서 10 개의 값을 사용하면 잘못된 방법을 적용하면 (예 : 시험에서) …

4
일관성을 유지하기 위해 추정기가 필요한 이유는 무엇입니까?
일관성있는 추정기의 수학적 정의를 이미 이해했다고 생각합니다. 틀린 점 있으면 지적 해주세요: WnWnW_n 위한 일관된 추정기이다θθ\theta 경우∀ϵ>0∀ϵ>0\forall \epsilon>0 limn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θlimn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θ\lim_{n\to\infty} P(|W_n - \theta|> \epsilon) = 0, \quad \forall\theta \in \Theta 여기서 ΘΘ\Theta 는 파라 메트릭 공간입니다. 그러나 견적자가 일관성을 유지해야 할 필요성을 이해하고 싶습니다. 일관성이없는 추정기가 나쁜 이유는 무엇입니까? 몇 가지 …


2
함수에 대한 분포는 무엇입니까?
CE Rasmussen과 CKI Williams의 기계 학습 을 위한 가우시안 프로세스 교과서를 읽고 있는데, 함수 분포 가 무엇을 의미 하는지 이해하는 데 어려움이 있습니다. 교과서에는 함수가 매우 긴 벡터 (사실, 무한히 길어야 하는가)로 상상해야한다는 예가 제시되어 있습니다. 함수에 대한 분포는 이러한 벡터 값의 "위"에 그려진 확률 분포라고 생각합니다. 그러면 함수가이 특정 …

4
인공 신경망이란 무엇입니까?
우리가 신경망 문학 을 탐구함에 따라 , 우리는 신경 형태 토폴로지 ( "Neural-Network"-like architectures)로 다른 방법을 식별하게된다. 저는 보편적 근사 정리 에 대해 이야기하고 있지 않습니다 . 아래에 예가 나와 있습니다. 그렇다면 인공 신경망의 정의는 무엇입니까? 그것의 토폴로지는 모든 것을 다루는 것처럼 보입니다. 예 : 우리가 처음으로 식별하는 것 중 …

5
선형 회귀 분석에서 가정의 필요성은 무엇입니까?
선형 회귀 분석에서 다음과 같은 가정을합니다. 예측 변수의 각 값 집합에서 반응의 평균 는 예측 변수의 선형 함수입니다.E(Yi)E(Yi)E(Y_i)(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) 오류 εiεiε_i 는 독립적입니다. 예측 변수의 각 값 세트 (x_ {1i}, x_ {2i},…) 에서 오류 ε_i 는 정규 분포입니다.εiεiε_i(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) 오류, εiεiε_i 예측기 값들의 각 세트에서, (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) , 같음 (편차를 …

4
능선 회귀의 동등한 공식 증명
통계 학습에서 가장 인기있는 책을 읽었습니다 1- 통계 학습의 요소. 2- 통계 학습 소개 . 둘 다 능선 회귀에는 동등한 두 가지 공식이 있다고 언급합니다. 이 결과에 대해 이해할만한 수학적 증거가 있습니까? 나는 또한 Cross Validated를 겪었 지만 거기에서 확실한 증거를 찾을 수 없습니다. 또한 LASSO는 동일한 유형의 증명을 누릴 …

1
설명 적 모델링에서 편견을 최소화하는 이유는 무엇입니까? (Galit Shmueli의“설명 또는 예측”)
이 질문은 Galit Shmueli의 논문 "설명 또는 예측"을 참조 합니다. 구체적으로 1.5 절, "설명과 예측이 다르다"에서 Shmueli 교수는 다음과 같이 썼다. 설명 모델링에서 초점은 기본 이론의 가장 정확한 표현을 얻기 위해 편향을 최소화하는 데 있습니다. 내가 신문을 읽을 때마다 당황했습니다. 추정의 편향을 최소화하는 것은 어떤 의미에서 기본 이론을 가장 정확하게 …

2
신경 네트워크 대 다른 모든 것
Google 에서 이것에 대한 만족스러운 답변을 찾지 못했습니다 . 물론 내가 가진 데이터가 수백만 정도라면 딥 러닝이 길입니다. 그리고 빅 데이터가 없으면 기계 학습에 다른 방법을 사용하는 것이 좋습니다. 주어진 이유는 과적 합입니다. 기계 학습 : 즉 데이터, 특징 추출, 수집 된 것으로부터 새로운 특징 만들기 등 상관 관계가 큰 …

1
Newey-West (1987)와 Hansen-Hodrick (1980)의 비교
질문 : Newey-West (1987)와 Hansen-Hodrick (1980) 표준 오류 사용의 주요 차이점과 유사점은 무엇입니까? 어떤 상황에서 이들 중 하나가 다른 상황보다 선호되어야합니까? 노트: 각 조정 절차가 어떻게 작동하는지 알고 있습니다. 그러나 온라인이나 교과서에서 비교할 문서를 아직 찾지 못했습니다. 참조를 환영합니다! Newey-West는 "캐치 올 (catch-all)"HAC 표준 오류로 사용되는 반면 Hansen-Hodrick은 중복 된 …

2
시계열에 대한이 예측이 왜“꽤 열악”합니까?
신경망 사용법을 배우려고합니다. 이 튜토리얼 을 읽고있었습니다 . 의 값을 사용하여 t + 1 의 값을 예측 하여 시계열에 신경망을 피팅 한 후 저자는 다음 그림을 얻습니다. 여기서 파란색 선은 시계열, 녹색은 열차 데이터에 대한 예측, 빨간색은 테스트 데이터 예측 (테스트 기차 분할 사용)티티tt + 1티+1t+1 "모델이 훈련 데이터 세트와 …

3
서포트 벡터 머신 및 하이퍼 플레인에 대한 직감
내 프로젝트에서 이진 분류 (1 또는 0)를 예측하기위한 로지스틱 회귀 모델을 만들고 싶습니다. 나는 15 개의 변수를 가지고 있는데 그중 2 개는 범주 형이며 나머지는 연속 형과 이산 형 변수가 혼합되어 있습니다. 로지스틱 회귀 모델에 맞추기 위해 SVM, 퍼셉트론 또는 선형 프로그래밍을 사용하여 선형 분리 성을 확인하는 것이 좋습니다. 제안 …


3
분산 분석 가정 (분산 평등, 잔차 정규성)이 중요한 이유는 무엇입니까?
분산 분석을 실행할 때 데이터에 적용 할 수 있도록 테스트의 특정 가정이 존재해야한다는 메시지가 나타납니다. 테스트가 작동하기 위해 다음과 같은 가정이 필요한 이유를 이해하지 못했습니다. 종속 변수 (잔여)의 분산은 설계의 각 셀에서 동일해야합니다. 종속 변수 (잔여)는 설계의 각 셀에 대해 대략 정규 분포되어야합니다. I understand that there is a bit …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.