통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
일주일 동안 분 단위의 데이터를 시간 단위로 집계하는 방법은 무엇입니까?
매일 여러 데이터 열에 대한 시간별 평균을 구하고 동일한 그래프에 12 개의 "호스트"에 대한 결과를 어떻게 표시합니까? 즉, 24 시간 동안의 데이터가 몇 주 동안 표시되는지 그래프로 표시하고 싶습니다. 최종 목표는 샘플링 전후에이 데이터의 두 세트를 비교하는 것입니다. dates Host CPUIOWait CPUUser CPUSys 1 2011-02-11 23:55:12 db 0 14 8 …

5
M 추정기의 경험적 헤 시안이 무기 한일 수 있습니까?
횡단면 및 패널 데이터의 계량 경제학 분석 (357 페이지) 에서 Jeffrey Wooldridge 는 경험적 Hessian이 "우리가 작업하고있는 특정 샘플에 대해 양의 정한 또는 심지어 반의 정한 것으로 보장되지는 않는다"고 말합니다. 이것은 (수치 적 문제를 제외하고) 헤 시안이 주어진 표본에 대한 목적 함수를 최소화하는 매개 변수의 값과 M- 추정기의 정의의 결과로 …

2
지수 가중 이동 왜곡 / 커트 시스
지수 가중 이동 평균 및 공정의 표준 편차 을 계산하기위한 잘 알려진 온라인 공식이 (xn)n=0,1,2,…(xn)n=0,1,2,…(x_n)_{n=0,1,2,\dots}있습니다. 평균적으로 μn=(1−α)μn−1+αxnμn=(1−α)μn−1+αxn\mu_n = (1-\alpha) \mu_{n-1} + \alpha x_n 그리고 분산을 위해 σ2n=(1−α)σ2n−1+α(xn−μn−1)(xn−μn)σn2=(1−α)σn−12+α(xn−μn−1)(xn−μn)\sigma_n^2 = (1-\alpha) \sigma_{n-1}^2 + \alpha(x_n - \mu_{n-1})(x_n - \mu_n) 표준 편차를 계산할 수 있습니다. 지수 가중 된 제 3 및 제 4 중심 …

3
"멀티 코어"를 사용하기 위해 R 스크립트를 최적화하는 방법
CPU가 4 개인 Ubuntu-Lucid PC에서 GNU R을 사용하고 있습니다. 4 개의 CPU를 모두 사용하기 위해 "r-cran-multicore"패키지를 설치했습니다. 패키지 매뉴얼에는 내가 이해하는 실용적인 예제가 없기 때문에 4 개의 CPU를 모두 사용하기 위해 스크립트를 최적화하는 방법에 대한 조언이 필요합니다. 내 데이터 세트는 50,000 개의 행과 1600 개의 열이있는 data.frame (P1이라고 함)입니다. 각 …
15 r 

3
시계열에 대한 좋은 소개 (R 포함)
현재 통증 경험과 관련된 심리 사회적 특성에 대한 실험 데이터를 수집하고 있습니다. 이 과정에서 참가자들로부터 다양한 자체보고 및 암시 적 측정과 함께 GSR 및 BP 측정을 전자적으로 수집하고 있습니다. 나는 심리적 배경을 가지고 있으며 요인 분석, 선형 모델 및 실험 분석에 익숙합니다. 내 질문은 시계열 분석에 대해 배울 수있는 좋은 …


1
능선 회귀의 맥락에서 라그랑지안 이완
"통계학 학습의 요소"(2 판), p63에서 저자들은 능선 회귀 문제의 다음 두 가지 공식을 제시합니다. β^r 나는 d지이자형= 아르 기민β{ ∑나는 = 1엔( y나는− β0− ∑j = 1피엑스나는 jβ제이)2+ λ ∑j = 1피β2제이}β^아르 자형나는디지이자형=아르 민β{∑나는=1엔(와이나는−β0−∑제이=1피엑스나는제이β제이)2+λ∑제이=1피β제이2} \hat{\beta}^{ridge} = \underset{\beta}{\operatorname{argmin}} \left\{ \sum_{i=1}^N(y_i-\beta_0-\sum_{j=1}^p x_{ij} \beta_j)^2 + \lambda \sum_{j=1}^p \beta_j^2 \right\} 과 β^r 나는 d지이자형= …

3
R에서의 객체 지향 프로그래밍에 대한 튜토리얼
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 휴일 3 년 전 . 잠김 . 이 질문과 주제는 주제가 다르지만 역사적 의미가 있기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. R의 객체 지향 프로그래밍에 대한 자습서가 있습니까? 다음을 포함하면 좋을 것입니다. 클래스를 정의하는 방법; …
15 r 

4
회귀 모수에 대한 신뢰 구간 : 베이지안 대 고전
길이 n의 두 배열 x와 y가 주어지면 모델 y = a + b * x에 적합하고 기울기에 대한 95 % 신뢰 구간을 계산하려고합니다. 이것은 (b-델타, b + 델타)이며 여기서 b는 일반적인 방식으로 발견됩니다. delta = qt(0.975,df=n-2)*se.slope se.slope는 기울기의 표준 오차입니다. R에서 기울기의 표준 오차를 얻는 한 가지 방법은 summary(lm(y~x))$coef[2,2]입니다. 이제 …

5
가격을 모델링하는 방법?
나는 matemathics stackexchange site 에서이 질문 을했고 여기에서 물어볼 것을 권장했다. 취미 프로젝트를 진행 중이며 다음 문제에 대한 도움이 필요합니다. 약간의 맥락 기능과 가격에 대한 설명이있는 항목 모음이 있다고 가정 해 봅시다. 자동차와 가격 목록을 상상해보십시오. 모든 자동차에는 엔진 크기, 색상, 마력, 모델, 연도 등 기능 목록이 있습니다. 각 제조업체마다 …

2
VIF, 조건 지수 및 고유 값
현재 데이터 집합의 다중 공선 성을 평가하고 있습니다. VIF의 임계 값과 조건 지수가 위 / 위에서 문제를 나타내는 것은 무엇입니까? VIF : VIF 이 문제 라고 들었습니다 .≥ 10≥10\geq 10 두 개의 문제 변수를 제거한 후 VIF는 각 변수에 대해 입니다. 변수가 더 많은 치료를 필요로합니까, 아니면이 VIF가 괜찮게 보입니까?≤ …

2
Gibbs 샘플링에서 전체 조건은 어디에서 제공됩니까?
Metropolis-Hastings 및 Gibbs 샘플링과 같은 MCMC 알고리즘은 공동 후방 분포에서 샘플링하는 방법입니다. 저는 대도시의 번거 로움을 이해하고 쉽게 구현할 수 있다고 생각합니다. 어떻게 시작점을 선택하고 사후 밀도와 제안 밀도에 따라 무작위로 '매개 변수 공간을 걷습니다'. Gibbs 샘플링은 한 번에 하나의 매개 변수 만 업데이트하고 다른 매개 변수는 일정하게 유지하여 효과적으로 …
15 bayesian  mcmc  gibbs 

2
상자 그림에서 중앙값 대신 평균 표시 [닫기]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 3 개월 전 . 파이썬 matplotblib로 boxplot을 플로팅 할 때, 플롯의 중간 선은 분포의 중앙값입니다. 대신 평균 라인을 가질 가능성이 있습니까? 또는 다른 스타일로 옆에 플로팅합니다. 또한 …


2
난수와 멀티 코어 패키지
R로 프로그래밍 할 때 멀티 코어 패키지를 몇 번 사용했습니다. 그러나 난수가 어떻게 처리되는지에 대한 진술을 본 적이 없습니다. C와 함께 openMP를 사용할 때 적절한 병렬 RNG를 사용하는 데주의를 기울이지 만 R에서는 합리적인 무언가가 발생한다고 가정했습니다. 누구든지 현명한 일이 일어나고 있음을 확인할 수 있습니까? 예 문서에서 우리는 x <- foreach(icount(1000), …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.