통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
“긴장 올가미”가 표준 올가미와 다른 이유는 무엇입니까?
데이터 세트 시작하여 올가미를 적용하고 솔루션 β L을 구하면 데이터 세트 ( X S , Y )에 올가미를 다시 적용 할 수 있습니다 . 여기서 S 는 0이 아닌 세트입니다. ''LLASO ''솔루션이라고 불리는 솔루션 β R L 을 얻기 위해 β L의 색인 (내가 틀렸다면 나를 교정하십시오!) 솔루션 β L …

2
변수가 변환 된 LM과 GLM이 다른 이유
이 과정 유인물 (1 페이지)에 설명 된대로 선형 모델은 다음 형식으로 작성 될 수 있습니다. y=β1x1+⋯+βpxp+εi,y=β1x1+⋯+βpxp+εi, y = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, 여기서 yyy 는 반응 변수이고 xixix_{i} 는 ithithi^{th} 설명 변수. 테스트 가정을 충족시키기 위해 종종 응답 변수를 변환 할 수 있습니다. 예를 들어 …

1
벌점 형 회귀 분석에서 수축 매개 변수에 대해 가능한 가능한 값 범위는 무엇입니까?
올가미 또는 릿지 회귀에서는 종종 또는 α로 불리는 수축 매개 변수를 지정해야합니다 . 이 값은 종종 훈련 데이터에서 여러 가지 다른 값을 확인하고 테스트 데이터에서 어떤 R 2 가 가장 좋은지 확인함으로써 교차 검증을 통해 선택됩니다 . 확인해야 할 값의 범위는 무엇입니까? 그것은이다 ( 0 , 1 ) ?λλ\lambdaαα\alpha아르 자형2아르 …

2
ACF 및 PACF 검사를 통한 ARMA 계수 추정
ACF 및 PACF 플롯을 육안으로 검사하여 시계열에 대한 적절한 예측 모델을 어떻게 추정합니까? 어느 것이 (즉, ACF 또는 PACF) AR 또는 MA에게 말합니까 (또는 둘 다)? 그래프의 어느 부분이 계절 ARIMA의 계절 및 비 계절 부분을 알려줍니까? 아래 표시된 ACF 및 PCF 기능을 고려하십시오. 그것들은 두 개의 차이가있는 로그 변환 …

1
GLM의 로그 가능성이 글로벌 최대 값으로 수렴을 보장합니까?
내 질문은 : 일반화 된 선형 모델 (GLM)이 전체 최대 값으로 수렴되도록 보장됩니까? 그렇다면 왜 그렇습니까? 또한, 볼록 함을 보장하기 위해 링크 기능에는 어떤 제약이 있습니까? GLM에 대한 나의 이해는 이들이 매우 비선형 우도 함수를 최대화한다는 것입니다. 따라서 여러 로컬 최대 값이 있고 수렴 할 매개 변수 세트가 최적화 알고리즘의 …

2
추론에 대해 ARIMA 오류와 함께 회귀를 사용하는 경우의 정상 요구 사항은 무엇입니까?
추론을 위해 ARIMA 오류 (동적 회귀)와 함께 회귀를 사용할 때의 정상 요구 사항은 무엇입니까? 구체적으로, 나는 비정규 연속 결과 변수 , 비정규 연속 예측 변수 x a 및 더미 변수 처리 시리즈 x b가 있습니다. 치료가 제로 변화에서 2 표준 오차 이상인 결과 변수의 변화와 상관 관계가 있는지 알고 싶습니다.와이와이y엑스ㅏ엑스ㅏx_a엑스비엑스비x_b …

3
온라인 학습과 배치 학습의 차이점은 무엇입니까?
현재 John Duchi와 Yoram Singer의 Forward-Backward Splitting 을 사용한 Efficient Online and Batch Learning 논문을 읽었습니다 . '온라인'과 '배치'라는 용어의 사용법에 대해 매우 혼란스러워합니다. '온라인'은 훈련 데이터의 한 단위를 처리 한 후 가중치 매개 변수를 업데이트하는 것을 의미한다고 생각했습니다. 그런 다음 새로운 가중치 매개 변수를 사용하여 다음 훈련 데이터 단위를 …


2
올바른 최적화 알고리즘을 선택하는 방법은 무엇입니까?
함수의 최소값을 찾아야합니다. http://docs.scipy.org/doc/scipy/reference/optimize.html 에서 문서 읽기 동일한 작업을 수행하는 최소 몇 가지 알고리즘이 있습니다. 어떤 것을 선택해야하는지 어떻게 알 수 있습니까? 나열된 알고리즘 중 일부 다운 힐 심플 렉스 알고리즘을 사용하여 함수를 최소화하십시오. BFGS 알고리즘을 사용하여 기능을 최소화하십시오. 비선형 켤레 그라디언트 알고리즘으로 함수를 최소화하십시오. Newton-CG 방법을 사용하여 기능 f를 …

3
다 변수 회귀 분석에 변수를 더 추가하면 기존 변수의 계수가 변경됩니까?
3 개의 변수로 구성된 다 변수 (여러 독립 변수) 회귀 분석이 있다고 가정 해보십시오. 각 변수에는 주어진 계수가 있습니다. 4 번째 변수를 도입하고 회귀를 다시 실행하기로 결정한 경우, 3 개의 원래 변수 계수가 변경됩니까? 더 광범위하게 : 다 변수 (다중 독립 변수) 회귀 분석에서 주어진 변수의 계수가 다른 변수의 계수에 …

5
표본의 표본 추출 분포는 모집단 평균과 어떻게 비슷합니까?
통계를 배우려고 노력하고 있는데, 그것이 제대로 이해되지 않으면 어떤 것들을 배우지 못하게 막는 것이 널리 퍼져 있기 때문입니다. 샘플 수단의 샘플링 분포에 대한이 개념을 이해하는 데 어려움이 있습니다. 일부 책과 사이트에서 설명하는 방식을 이해할 수 없습니다. 나는 이해가 있다고 생각하지만 그것이 정확한지 확실하지 않습니다. 아래는 그것을 이해하려는 시도입니다. 정규 분포를 …

3
결 측값 및 / 또는 불규칙한 시계열이있는 R 예측 패키지 사용
R forecast패키지뿐만 아니라 zoo불규칙한 시계열 및 결 측값 보간에 대한 패키지에 깊은 인상을 받았습니다 . 내 응용 프로그램이 콜 센터 트래픽 예측 영역에 있으므로 주말의 데이터가 거의 누락되어 거의 처리 할 수 ​​있습니다 zoo. 또한 일부 불연속 점이 누락 될 수 있으므로 R을 사용 NA합니다. 건은 다음과 같은 예측 패키지의 …

2
R의 캐럿 패키지에서 PCA 및 k- 폴드 교차 검증
방금 Coursera의 기계 학습 과정에서 강의를 다시 보았습니다. 교수는지도 학습 응용 프로그램의 전처리 데이터에 대한 PCA에 대해 논의하는 섹션에서 PCA는 훈련 데이터에 대해서만 수행되어야하며 매핑은 교차 검증 및 테스트 세트를 변환하는 데 사용됩니다. PCA 및 열차 / 시험 분할 도 참조하십시오 . 그러나 caretR 패키지에서 train()함수에 전달한 학습 데이터 는 …

2
포아송 모델의 경우 잔류 이탈도 / df가 ~ 1이어야한다고 가정하면 대략적인 수치는 얼마입니까?
Poisson 모형 적합이 잔차 편차를 자유 도로 나누는 것과 관련하여 과도하게 분산되어 있는지 여부를 확인하기위한 조언을 자주 보았습니다. 결과 비율은 "약 1"이어야합니다. 문제는 우리가 "대략적인"범위에 대해 이야기하는 것입니다. 대체 모델 형태를 고려하기 위해 알람을 설정해야하는 비율은 무엇입니까?

5
교육 데이터를 늘리면 전체 시스템 정확도에 어떤 영향이 있습니까?
어떤 상황에서 훈련 데이터를 늘리면 전체 시스템이 향상 될 수 있는지 예를 들어 누군가를 요약 해 줄 수 있습니까? 더 많은 훈련 데이터를 추가하면 데이터가 과적 합 될 수 있고 테스트 데이터에 대한 정확도가 높지 않다는 것을 언제 감지 할 수 있습니까? 이것은 매우 구체적이지 않은 질문이지만 특정 상황에 대한 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.