통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
가설 검정과 과학적 방법
이 글에 대한 답을 읽고 가설 테스트 가 과학적 방법 과 어떤 관련이 있는지 궁금해지기 시작했습니다 . 둘 다 잘 이해하고 있지만, 그들 사이의 정확한 연결을 그리는 데 어려움을 겪고 있습니다. 과학적인 방법은 높은 수준에서 다음과 같습니다. 추측 및 가설 만들기 (이론) 이 이론에서 예측 실험 및 관찰 수행 새로운 …


3
미국에서 전화 여론 조사에 대한 편견이 있습니까?
WashingtonTimes / ABC 설문 조사를보고 있었는데 특히 나이별로 결과가 나에게 놀라운 것처럼 보였습니다. 그래서 편견을 찾아갔습니다. "여론 조사는 성인 1,000 명 중 무작위 표본 중 2014 년 12 월 11 일부터 14 일까지 전화로 진행되었습니다. 인터뷰는 유선 전화와 휴대 전화에서 영어와 스페인어로 진행되었습니다." 설문 조사는 각 연령대의 응답자 수를 제게 …
11 polling  politics 

1
깁스 샘플링을 얻는 방법?
Gibbs 샘플링에 대한 다른 질문이나 Wikipedia가 언급 될까봐 두려워서 실제로 물어 보는 것이 주저하고 있지만, 그들이 실제로 무엇을 묘사하고 있는지에 대한 느낌이 없습니다. 조건부 확률 : p(x|y)p(x|y)p(x|y)p(x|y)x=x0x=x1y=y01434y=y12646p(x|y)y=y0y=y1x=x01426x=x13446 \begin{array}{c|c|c} p(x|y) & y = y_0 & y = y_1 \\ \hline x = x_0 & \tfrac{1}{4} & \tfrac{2}{6} \\ \hline x = …
11 sampling  mcmc  gibbs 

2
히스토그램에 종 모양의 곡선이 표시되면 데이터가 정상적으로 분포되어 있다고 말할 수 있습니까?
응답자 연령에 대한 히스토그램을 만들고 아주 멋진 종 모양의 곡선을 얻었으므로 분포가 정상이라고 결론을 내 렸습니다. 그런 다음 SPSS에서 n = 169로 정규성 검정을 실행했습니다 . Kolmogorov-Smirnov 검정 의 p- 값 (Sig.)이 0.05 미만이므로 데이터가 정규성 가정을 위반했습니다. 테스트에서 나이 분포가 정상이 아니라고 히스토그램이 종 모양의 곡선을 나타내는 이유는 무엇입니까? …

2
이벤트 연구 방법론에 대한 베이지안 접근의 계량 경제학
이벤트 연구는 이벤트가 주가에 미치는 영향을 결정하기 위해 경제 및 금융 분야에서 널리 퍼져 있지만 거의 항상 잦은 추론에 근거합니다. 이벤트 기간과 다른 기준 기간 동안의 OLS 회귀 분석은 일반적으로 자산의 정상 수익을 모델링하는 데 필요한 매개 변수를 결정하는 데 사용됩니다. 자산 i 에 대한 누적 비정상 수익률 ( ) …

1
ACF 그래프는 내 데이터에 대해 무엇을 알려줍니까?
두 가지 데이터 세트가 있습니다. 첫 번째 데이터 세트는 시간에 대한 투자 가치 (십억 달러)이며, 각 단위 시간은 1947 년 1 분기 이후 1/4이되었습니다. 시간은 2002 년 3 분기로 연장됩니다. 두 번째 데이터 세트는 "[첫 번째 데이터 세트]에 대한 투자 가치를 대략 고정 된 프로세스로 변환 한 결과"입니다. 첫 번째 …

2
p- 값 미묘 : 더 큰 대 더 큰
Wassermann의 All of Statistics를 읽으면서 p- 값의 정의에 미묘한 미묘함이 있음을 알았습니다. 비공식적으로 Wassermann은 p- 값을 [..] 검정 통계량 의 값을 실제로 관찰 한 것과 같거나 더 극단적 으로 관찰 할 확률 ( 하에서 ) .H0H0H_0 강조가 추가되었습니다. 좀 더 공식적으로 (Theorem 10.12) : size test의 형식이αα\alpha 경우에만 거부하십시오 . …

1
회귀 모형의 변수에 대한 제어와 연구 설계의 변수에 대한 제어의 차이점은 무엇입니까?
연구 설계에서 변수를 제어하는 ​​것이 회귀 모델에서 사후 제어를하는 것보다 오류를 줄이는 데 더 효과적이라고 생각합니다. 이 "통제"의 두 가지 사례가 어떻게 다른지 공식적으로 설명해 주시겠습니까? 오류를 줄이고 더 정확한 예측을하는 데 얼마나 효과적입니까?

1
R의 몬테카를로 시뮬레이션
다음 운동을 해결하려고하지만 실제로이 작업을 시작하는 방법에 대한 실마리는 없습니다. 내 책에서 코드처럼 보이는 코드를 찾았지만 완전히 다른 연습이며 서로 연관시키는 방법을 모르겠습니다. 도착 시뮬레이션을 시작하려면 어떻게해야하며 도착이 언제인지 어떻게 알 수 있습니까? 나는 그것들을 저장하는 방법을 알고 그것에 따라 a, b, c, d를 계산합니다. 그러나 실제로 몬테 카를로 시뮬레이션을 …

1
왼쪽 검열 된 데이터에 표준 기계 학습 도구 사용
수입 업체가 유통 업체의 고객 네트워크에서 제품 수요를 예측할 수 있도록하는 예측 애플리케이션을 개발 중입니다. 판매량은 수요를 충족시키기에 충분한 재고가있는 한 수요에 대한 대리입니다. 하지만 재고를 0으로 낮추면 (고객이 피하는 데 도움이되는 상황) 목표를 놓친 부분을 많이 알지 못합니다. 고객이 얼마나 많은 판매를했을까요? 충분한 공급이 있었습니까? Sales를 간단한 대상 변수로 …

4
시계열에서의 이상치 탐지 : 오 탐지를 줄이는 방법은 무엇입니까?
시계열에서 이상치 탐지를 자동화하려고하는데 여기에서 Rob Hyndman이 제안한 솔루션 수정을 사용했습니다 . 여러 국가의 웹 사이트 방문을 매일 측정합니다. 일일 방문이 몇 번 또는 몇 천 번인 일부 국가의 경우 내 방법이 합리적으로 작동하는 것 같습니다. 그러나 국가가 하루에 1 ~ 2 회 방문으로 이어지는 경우 알고리즘의 한계가 매우 좁아서 …


2
glmnet : 다항식 매개 변수를 이해하는 방법은 무엇입니까?
다음 문제 : glmnet ()을 사용하여 하나 이상의 범주 형 변수로 범주 형 응답 변수를 예측하고 싶습니다. 그러나 glmnet이 제공하는 출력을 이해할 수 없습니다. 먼저 두 가지 관련 범주 형 변수를 생성 해 보겠습니다. 데이터 생성 p <- 2 #number variables mu <- rep(0,p) sigma <- matrix(rep(0,p^2), ncol=p) sigma[1,2] <- …

2
이차 프로그래밍 및 올가미
올가미 회귀를 수행하려고하는데 다음과 같은 형식이 있습니다. 에서 최소화( Y - X w ) ' ( Y - X w ) + λwww(Y−Xw)′(Y−Xw)+λ|w|1(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 주어지면 2 차 프로그래밍의 도움으로 다음과 같은 형식으로 최적의 를 찾는 것이 좋습니다 .wλλ\lambdawww 따라 에서 를 최소화1xxxX≤B.12x′Qx+c′x12x′Qx+c′x\frac{1}{2} x'Qx + …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.