통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
표본 평균을 고려한 표본 중앙값의 예상 값
하자 평균을 나타내며하자 크기의 임의의 샘플의 평균을 나타내며 인 분포 . 는 어떻게 계산할 수 있습니까?YYYX¯X¯\bar{X}n=2k+1n=2k+1n=2k+1N(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)E(Y|X¯=x¯)E(Y|X¯=x¯)E(Y|\bar{X}=\bar{x}) 직관적으로, 정규성 가정으로 인해 이며 실제로 정답 이라고 주장하는 것이 합리적 입니다. 그래도 엄격하게 보여줄 수 있습니까?E(Y|X¯=x¯)=x¯E(Y|X¯=x¯)=x¯E(Y|\bar{X}=\bar{x})=\bar{x} 저의 초기 생각은 일반적으로 알려진 결과 인 조건부 정규 분포를 사용하여이 문제에 접근하는 것이 었습니다. 문제는 예상 …

1
충분한 통계, 특성 / 직관 문제
나는 재미에 대한 몇 가지 통계를 가르치고 있으며 충분한 통계 에 대해 약간의 혼란이 있습니다. 혼동을 목록 형식으로 작성하겠습니다. 분포에 모수가있는 경우 충분한 통계가 있습니까?nnnnnn 충분한 통계와 매개 변수간에 직접적인 대응이 있습니까? 또는 충분한 통계가 "정보"풀 역할을하여 설정을 다시 만들 수 있으므로 기본 분포의 모수에 대해 동일한 추정값을 계산할 수 …

2
지도에서 공간 및 시간적 상관 관계 표시
미국 전역의 기상 관측소 네트워크에 대한 데이터가 있습니다. 이것은 날짜, 위도, 경도 및 일부 측정 값을 포함하는 데이터 프레임을 제공합니다. 데이터가 하루에 한 번 수집되고 지역 규모의 날씨에 의해 구동된다고 가정합니다 (아니, 우리는 그 논의에 참여하지 않을 것입니다). 동시에 측정 된 값이 시간과 공간에서 어떻게 상관되는지 그래픽으로 보여주고 싶습니다. 저의 …

1
ARIMA 주문 정의 문제
이것은 긴 게시물이므로 나와 함께 견딜 수 있기를 바랍니다. 잘못된 부분을 수정하십시오. 저의 목표는 3 주 또는 4주의 과거 데이터를 기반으로 일일 예측을 작성하는 것입니다. 데이터는 변압기 라인 중 하나의 로컬 부하에 대한 15 분 데이터입니다. 계절 ARIMA 프로세스의 모델 순서를 찾는 데 문제가 있습니다. 전력 수요 시계열을 고려하십시오. 원래 …

2
임의 포리스트를 사용한 기능 선택
나는 주로 재정적 변수가 많은 데이터 세트 (120 가지 특징, 4k 예제)를 가지고 있으며 상관 관계가 높고 소음이 심합니다 (예 : 기술 지표). 나중에 모델 훈련 (이진 분류)과 함께 사용하기 위해 최대 20-30을 선택하고 싶습니다. - 증가 감소). 기능 순위에 임의 포리스트를 사용하려고 생각했습니다. 재귀 적으로 사용하는 것이 좋습니다? 예를 …

4
충분한 시련을 겪으면 희귀 한 일이 발생한다고 말하는 법이 있습니까?
로드 된 주사위에 관한 비디오를 만들려고 노력하고 있습니다. 비디오의 어느 시점에서 우리는 약 200 개의 주사위를 굴려서 6 개를 모두 다시 굴려서 6 개를 모두 굴려서 세 번째로 굴립니다. 우리는 한 번에 6 번씩 6 번 나온 주사위를 가지고 있었는데, 이는 1/216의 확률로 발생하고 약 200 개의 주사위를 가지고 있었기 …


2
일류 SVM과 모범 SVM
나는 부정적인 데이터가 없다는 것을 염두에두고 단일 클래스 SVM (OSVM)이 제안되었고, 그들은 긍정적 세트와 부정적인 앵커 포인트를 분리하는 결정 경계를 찾으려고 노력한다는 것을 이해합니다. 2011 년의 연구는 OSVM과는 다른 "범주 별 분류기"를 훈련시키는 ESVM ( Exemplar SVM )을 제안 합니다. 계산 " 이것이 의미하는 바와 ESVM이 OSVM과 어떻게 다른지 잘 …

3
다변량 정규 분포에서 표본을 추출하기위한 hole 레 스키 대 고유 분해
샘플 싶습니다 . Wikipedia 는 hole 레 스키 (Cholesky) 또는 고유 분해 (Eigendecomposition) , 즉 Σ = D 1 D T 1 또는 Σ = Q Λ Q Tx∼N(0,Σ)x∼N(0,Σ)\mathbf{x} \sim N\left(\mathbf{0}, \mathbf{\Sigma} \right)Σ=D1DT1Σ=D1D1T \mathbf{\Sigma} = \mathbf{D}_1\mathbf{D}_1^T Σ=QΛQTΣ=QΛQT \mathbf{\Sigma} = \mathbf{Q}\mathbf{\Lambda}\mathbf{Q}^T 따라서 샘플은 다음을 통해 그릴 수 있습니다 : 또는 x …

3
다중 회귀 분석에서 예측 변수 사이에 r 제곱을 나누는 방법은 무엇입니까?
방금 저자가 두 개의 예측 변수로 다중 회귀 분석을 수행 한 논문을 읽었습니다. 전체 r- 제곱 값은 0.65였다. 그들은 두 예측 변수 사이에 r 제곱을 나누는 테이블을 제공했습니다. 테이블은 다음과 같습니다. rsquared beta df pvalue whole model 0.65 NA 2, 9 0.008 predictor 1 0.38 1.01 1, 10 0.002 predictor …

3
변수가 같은 분포를 따르는 지 테스트
두 변수가 동일한 분포를 따르는 지 여부를 테스트하려면 두 변수를 정렬 한 다음 상관 관계를 확인하는 것이 좋은 테스트입니까? 이 값이 높으면 (적어도 0.9?) 변수는 같은 분포에서 나옵니다. 여기서 분포는 "정상", "카이 제곱", "감마"등을 의미합니다.

2
Augmented Dickey Fuller 테스트와 혼동
electricityR 패키지에서 사용할 수 있는 데이터 세트를 작업 중입니다 TSA. 저의 목표는 arima모델이이 데이터에 적합한 지 알아 내고 결국에는 맞는지 알아내는 것입니다. 그래서 나는 다음과 같이 진행했습니다 : 1 : 다음 그래프의 결과 인 시계열을 플로팅하십시오 : 2 : electricity분산을 안정화 하기 위해 로그를 만들고 싶었 습니다. adf(Augmented Dickey Fuller) …

2
R 언어 rnorm과 runif의 차이점은 무엇입니까?
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 육년 전 . 함수 rnorm와 runifR 의 차이점은 무엇입니까 ?
16 r 



당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.