통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
세타는 무엇을 의미합니까?
나는 통계에 초보자이며 이것을 찾았 습니다 . 통계에서 소문자 그리스 문자 'theta'인 θ는 일반적인 확률 분포의 (벡터로 구성된) 모수에 대한 일반적인 이름입니다. 일반적인 문제는 세타의 값을 찾는 것입니다. 이런 식으로 매개 변수 이름을 지정하는 것은 의미가 없습니다. 우리는 그것을 다른 것으로 부를 수도 있습니다. 실제로 많은 배포판에는 일반적으로 다른 이름이 …

3
k- 폴드 교차 검증에 대한 그리드 검색
10 배 교차 유효성 검사 설정에서 120 샘플의 데이터 세트가 있습니다. 현재 첫 번째 홀드 아웃의 교육 데이터를 선택하고 그리드 검색을 통해 감마 및 C의 값을 선택하기 위해 5 배 교차 검증을 수행합니다. RBF 커널과 함께 SVM을 사용하고 있습니다. 정밀도를보고하기 위해 10 개의 교차 검증을 수행하고 있으므로 각 홀드 아웃의 …

1
의 Quantile에 대한 닫힌 형태 표현
두 개의 랜덤 변수가 있습니다. 여기서 U ( 0 ,αi∼iid U(0,1),i=1,2αi∼iid U(0,1),i=1,2\alpha_i\sim \text{iid }U(0,1),\;\;i=1,2 은 균일 한 0-1 분포입니다.U(0,1)U(0,1)U(0,1) 그런 다음 프로세스가 생성됩니다. P(x)=α1sin(x)+α2cos(x),x∈(0,2π)P(x)=α1sin⁡(x)+α2cos⁡(x),x∈(0,2π)P(x)=\alpha_1\sin(x)+\alpha_2\cos(x), \;\;\;x\in (0,2\pi) 지금,가 폐쇄 된 형태의 발현이인지 궁금 의 이론적 인 75 %의 분위수 P ( X ) 주어진 대한 X ∈ ( 0 , 2 …

1
Wishart 행렬의 로그 결정자의 예상 값
하자 , 즉,이에 따라 배포 D × D 차원 Wishart의 평균과 분산 ν Ψ 자유와도 ν . E ( log | Λ | )에 대한 표현식을 원합니다. 여기서 | Λ | 결정자입니다.Λ∼WD(ν,Ψ)Λ∼WD(ν,Ψ)\Lambda \sim \mathcal W_D(\nu, \Psi)D×DD×DD \times DνΨνΨ\nu \Psiνν\nuE(log|Λ|)E(log⁡|Λ|)E(\log |\Lambda|)|Λ||Λ||\Lambda| 나는 이것에 대한 답변을 약간 봤으며 충돌하는 정보를 얻었습니다. 이 …

2
GBM 분류에 불균형 한 수업 규모가 있습니까?
감독 이진 분류 문제를 처리하고 있습니다. GBM 패키지를 사용하여 개인을 감염되지 않은 / 감염된 것으로 분류하고 싶습니다. 감염된 사람보다 15 배나 더 감염되지 않았습니다. 클래스 크기가 불균형 한 경우 GBM 모델이 어려움을 겪고 있는지 궁금합니다. 이 질문에 대한 답변이 없습니다. 감염되지 않은 개인에게 1의 무게를, 감염된 사람에 15의 무게를 할당하여 …

2
잔차 이분산성 측정
이 위키 백과 링크 에는 OLS 잔차 이분산성을 감지하는 여러 기술이 나열되어 있습니다. 이분산성에 영향을받는 영역을 감지하는 데 어떤 실습 기술이 더 효율적인지 알고 싶습니다. 예를 들어, 여기 OLS '잔여량 대 적합치'그림의 중앙 영역이 그림의 측면보다 더 높은 분산을 갖는 것으로 나타났습니다 (사실은 확실하지 않지만 문제의 경우라고 가정하겠습니다). 확인하기 위해 …

3
Auto.arima와 autobox의 차이점은 무엇입니까?
이 사이트에 읽는 글에서 나는 R의가 알고있는 기능을 auto.arima 합니다 (에서 forecast 패키지 ). 또한 이 사이트의 회원 인 IrishStat 는 1980 년대 초에 상용 패키지 오토 박스 를 구축 했음을 알고 있습니다. 이 두 패키지가 현재 존재하고 주어진 데이터 세트에 대해 자동으로 arima 모델을 선택함에 따라 다르게 수행하는 작업은 …

1
가우스 프로세스 : 함수 근사 속성
Gaussian Process에 대해 배우고 있으며 조금만 들었습니다. 의견과 답변에 감사드립니다. 모든 데이터 세트에 대해 가우스 프로세스 함수 근사가 데이터 포인트에서 0 또는 무시할 수있는 피팅 오류를 발생시키는 것이 사실입니까? 다른 곳에서는 가우시안 프로세스가 노이즈 데이터에 특히 좋다고 들었습니다. 이것은 관찰 된 데이터의 낮은 피팅 오류와 충돌하는 것 같습니다. 또한 데이터 …

3
멀티 클래스 LDA 교육의 공선 변수
8 클래스 의 데이터 로 다중 클래스 LDA 분류기를 훈련하고 있습니다. 교육을 수행하는 동안 " 변수는 동일 선상에 있습니다 " 라는 경고가 표시됩니다. 90 % 이상의 훈련 정확도를 얻고 있습니다. Python 에서 scikits-learn 라이브러리를 사용 하여 다중 클래스 데이터를 훈련시키고 테스트합니다. 나는 적절한 테스트 정확도도 얻 습니다 (약 85 % …

3
MLE에 iid 데이터가 필요합니까? 아니면 그냥 독립 매개 변수?
최대 우도 추정 (MLE)을 사용하여 모수를 추정하려면 우도 함수를 평가해야합니다. 우도 함수는 분포 패밀리 (P (X = x | θ)가 주어지면 모수 공간 (θ)의 값 (x)에 표본 (X)이 발생할 확률을 매핑합니다. )의 가능한 값을 초과하여 (주 : 이것에 맞습니까?) 내가 본 모든 예는 F (X)의 곱을 취하여 P (X = …

4
R 형식이 일치하지 않는 데이터를 정리 하시겠습니까?
통계를 수행하기 전에 많은 정리가 필요한 지저분한 설문 조사 데이터를 다루는 경우가 많습니다. Excel에서이 작업을 "수동으로"수행하고, 때로는 Excel 수식을 사용하고, 항목을 하나씩 확인하는 경우가있었습니다. 나는 R에서 스크립트를 작성함으로써 훨씬 더 많은 작업을 시작했다. R에서 스크립트를 작성함으로써 매우 유익했다. 업데이트). 그러나 여전히 효율적으로 처리하는 데 문제가있는 몇 가지 유형의 데이터가 있습니다. …
16 r  data-cleaning 

2
가중 평균 추정의 계산 표준 오차
그 가정 및 X 1 , X 2 , . . . , X는 N 각 그려 IID 와 일부 분포로부터 w I 독립의 X 나 . w 난 엄격히 긍정적이다. 당신은 모든 관찰 승 내가 아닌 X I ; 오히려 당신은 ∑ i x i w 를 관찰합니다w1,w2,…,wnw1,w2,…,wnw_1,w_2,\ldots,w_nx1,x2,...,xnx1,x2,...,xnx_1,x_2,...,x_nwiwiw_ixixix_iwiwiw_iwiwiw_ixixix_i∑ixiwi∑ixiwi\sum_i x_i …

3
데이터 세트 변경 후 기존 표준 편차를 사용하여 새로운 표준 편차 계산
I have an array of nnn real values, which has mean μoldμold\mu_{old} and standard deviation σoldσold\sigma_{old}. If an element of the array xixix_i is replaced by another element xjxjx_j, then new mean will be μnew=μold+xj−xinμnew=μold+xj−xin\mu_{new}=\mu_{old}+\frac{x_j-x_i}{n} 이 방법의 장점은 값에 관계없이 일정한 계산이 필요하다는 것 입니다. 계산에 대한 접근도는 σ N …

3
일 변량 지수 혹 프로세스의 MLE 찾기
단 변량 지수 혹 프로세스는 다음과 같은 이벤트 도달률을 갖는 자체 자극 포인트 프로세스입니다. λ(t)=μ+∑ti&lt;tαe−β(t−ti)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} 여기서, 은 이벤트 도착 시간입니다.t1,..tnt1,..tn t_1,..t_n 로그 우도 함수는 −tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln(μ+αe−β(tj−ti))−tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln⁡(μ+αe−β(tj−ti)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum\limits_{i<j}{\ln(\mu+\alpha e^{-\beta(t_j-t_i)})} 재귀 적으로 계산할 수 있습니다. −tnμ+αβ∑(e−β(tn−ti)−1)+∑ln(μ+αR(i))−tnμ+αβ∑(e−β(tn−ti)−1)+∑ln⁡(μ+αR(i)) - t_n …

1
짧은 다변량 시계열을 예측하는 가장 어리석은 방법
29 번째 시간 단위에 대해 다음 4 가지 변수를 예측해야합니다. 대략 2 년 분량의 기록 데이터가 있으며 여기서 1과 14와 27은 모두 같은 기간 (또는 연도)입니다. 결국, 나는 , w d , w c 및 p 에서 Oaxaca-Blinder 스타일 분해를 하고 있습니다.여여W승 d승디wd승 c승씨wc피피p 있습니다. time W wd wc p …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.