통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
IID 샘플링 테스트
샘플링이 IID (독립적이고 동일하게 분배 됨)인지 어떻게 테스트하거나 확인 하시겠습니까? 나는 가우시안과 동일하게 분산 된 것이 아니라 IID만을 의미합니다. 그리고 내 생각은 아이디어를 동일한 크기의 두 개의 하위 샘플로 반복해서 분할하고 Kolmogorov-Smirnov 테스트를 수행하고 p- 값의 분포가 균일한지 확인하는 것입니다. 이 접근법에 대한 의견과 제안은 환영합니다. 현상금 시작 후 설명 …

3
공식이나 분석에서 데이터를 시뮬레이션하는 일반적인 방법이 있습니까?
실험 설계 데이터 프레임에서 데 노보 데이터의 시뮬레이션. R에 중점을 둔다면 (다른 언어 솔루션도 훌륭 할 것입니다). 실험 또는 측량을 설계 할 때 데이터를 시뮬레이션하고이 시뮬레이션 된 데이터에 대한 분석을 수행하면 설계의 장단점에 대한 훌륭한 통찰력을 얻을 수 있습니다. 이러한 접근법은 통계 테스트의 이해와 올바른 사용에 필수적 일 수 있습니다. …

3
통계적 배경이없는 사람들에게 일반화 된 선형 모델을 어떻게 설명 하시겠습니까?
나는 통계적 배경이없는 청중에게 통계 기술을 설명하는 데 어려움을 겪고 있습니다. 통계 관용어를 버리지 않고 GLM이 그러한 대상에게 어떤 것인지 설명하고 싶을 때 가장 효과적인 방법은 무엇입니까? 나는 보통 GLM을 (1) 응답 변수 인 랜덤 성분, (2) 선형 예측 변수 인 시스템 성분, (3) 연결의 "핵심"링크 기능 (1)과 (2). 그런 …

4
교차 검증 전 정규화
k- 폴드 교차 검증을 반복하기 전에 정규화 데이터 (평균이 0이고 표준 편차가 0이 됨)가 과적 합과 같은 부정적인 영향을 미칩니 까? 참고 : 이것은 #cases> total #features 인 상황을위한 것입니다. 로그 변환을 사용하여 일부 데이터를 변환 한 다음 위와 같이 모든 데이터를 정규화하고 있습니다. 그런 다음 기능 선택을 수행하고 있습니다. …

2
서버 응답 시간을 모델링하는 데 가장 일반적으로 사용되는 배포는 무엇입니까?
서블릿 기반 응용 프로그램이 있는데,이 서블릿에 대한 각 요청을 완료하는 데 걸린 시간을 측정합니다. 평균과 최대 값과 같은 간단한 통계를 이미 계산했습니다. 그러나 좀 더 정교한 분석을 만들고 싶습니다. 그렇게하려면 이러한 응답 시간을 올바르게 모델링해야한다고 생각합니다. 확실히, 응답 시간은 잘 알려진 분포를 따르며, 분포가 올바른 모형이라고 믿을만한 충분한 이유가 있습니다. …

6
일련의 데이터에서 로컬 피크 / 밸리를 찾는 방법은 무엇입니까?
내 실험은 다음과 같습니다. quantmod 패키지 findPeaks에서 함수를 사용하고 있습니다 . 공차 5 내에서 "로컬"피크, 즉 시계열이 로컬 피크에서 5만큼 떨어진 후 첫 번째 위치를 감지하려고합니다. aa=100:1 bb=sin(aa/3) cc=aa*bb plot(cc, type="l") p=findPeaks(cc, 5) points(p, cc[p]) p 출력은 [1] 3 22 41 3보다 더 많은 "로컬 피크"를 기대하고 있기 때문에 잘못된 …
16 r  time-series 

4
통계 분석의 특정 측면을 설명하는 데 유용한 데이터 세트는 무엇입니까?
나는 이것이 주관적이라는 것을 알고 있지만, 우리가 가장 좋아하는 데이터 세트와 우리가 생각하는 것들에 대해 이야기하는 것이 좋을 것이라고 생각했습니다. 풍부한 데이터가 있으며 모든 API (예 : Datamob )와 클래식 데이터 세트 (예 : R data )를 사용하면 매우 흥미로운 응답을 얻을 수 있다고 생각합니다. 예를 들어, 나는 항상 "Boston …
16 dataset 

6
R의 계산 속도?
저는 현재 큰 확률 론적 모델 중 하나를 SAS에서 새로운 언어로 옮기는 일을 맡았습니다. 개인적으로, 나는 전통적인 컴파일 언어를 선호하지만, PI는 내가 사용한 적이없는 R을 확인하기를 원합니다. SAS에서 모델을 가져 오기위한 우리의 동기는 (1) 많은 사람들이 SAS가 비싸기 때문에이 모델에 액세스 할 수 없다는 것입니다. 우리가 가진 모델의 유형. (1)에 …
16 r  computing 

2
카운트 데이터와 과대 산포가있는 회귀 분석에서 포아송 또는 준 포아송?
계산 데이터가 있습니다 (많은 요인에 따라 고객 수를 계산하여 요구 / 제공 분석). 정상적인 오류로 선형 회귀를 시도했지만 QQ 플롯이 실제로 좋지 않습니다. 나는 대답의 로그 변환을 시도했다 : 다시 한 번 나쁜 QQ 플롯. 이제 Poisson Errors로 회귀를 시도하고 있습니다. 모든 중요한 변수가있는 모델을 사용하면 다음과 같은 결과를 얻습니다. …

1
회귀 분석에서 데이터 센터링 및 표준화 필요
일부 정규화와 선형 회귀를 고려 : 예 찾기 것을 최소화 | | A x − b | | 2 + λ | | x | | 1xxx||Ax−b||2+λ||x||1||Ax−b||2+λ||x||1||Ax - b||^2+\lambda||x||_1 일반적으로 A의 열은 평균이 0이고 단위 규범을 갖도록 표준화되고 는 평균이 0이되도록 중앙에 배치됩니다. 표준화 및 센터링 사유에 대한 나의 이해가 …

2
직교 투영법의 투영 행렬이 왜 대칭입니까?
나는 이것에 익숙하지 않으므로 질문이 순진한 경우 용서하기를 바랍니다. (상황 : 나는 Davidson & MacKinnon의 저서 "Econometric Theory and Methods" 에서 계량 경제학을 배우고 있는데 이것을 설명하지 않는 것 같습니다. 또한 조금 더 진보 된 수준의 예측을 다루는 Luenberger의 최적화 책을 보았습니다. 운이 없다). 내가 직교 투영 와 관련 투영 …

4
클래식 선형 모델-모델 선택
5 개의 가능한 회귀 변수가있는 고전적인 선형 모델이 있습니다. 그것들은 서로 관련이 없으며 응답과의 상관 관계가 매우 낮습니다. 회귀 분석기 중 3 개가 t 통계량에 유의 한 계수를 갖는 모형에 도달했습니다 (p <0.05). 나머지 2 개의 변수 중 하나 또는 둘 다를 추가하면 t 통계에 대한 p 값> 0.05가 추가되고 …

1
가중 유클리드 거리를 사용하는시기와 사용할 무게를 결정하는 방법
각 데이터가 nnn 다른 측정 값 으로 구성된 일련의 데이터가 있습니다. 각 측정에 대해 벤치 마크 값이 있습니다. 각 데이터가 벤치 마크 값에 얼마나 가까운 지 알고 싶습니다. 가중 유클리드 거리를 다음과 같이 사용하려고 생각했습니다. dx,b=(∑ni=1wi(xi−bi)2))1/2dx,b=(∑i=1nwi(xi−bi)2))1/2\hspace{0.5in} d_{x,b}=\left( \sum_{i=1}^{n}w_i(x_i-b_i)^2)\right)^{1/2} 어디 xixi\hspace{0.5in}x_i 는 특정 데이터에 대한 i 번째 측정 값입니다. bibi\hspace{0.5in}b_i 는 …

4
다항 로지스틱 회귀 분석에서 exp (B) 해석
이것은 초보자의 질문이지만 다항 로지스틱 회귀 모델에서 6.012의 exp (B) 결과를 어떻게 해석합니까? 1) 6.012-1.0 = 5.012 = 5012 %의 위험 증가입니까? 또는 2) 6.012 / (1 + 6.012) = 0.857 = 85.7 % 위험 증가? 두 대안이 모두 틀린 경우 누군가 올바른 방법을 언급 할 수 있습니까? 인터넷에서 많은 …

1
비선형 회귀에 대한 예측 대역을 계산하는 방법은 무엇입니까?
Prism 의 도움말 페이지 는 비선형 회귀에 대한 예측 밴드를 계산하는 방법에 대한 다음 설명을 제공합니다. 긴 따옴표를 용서하십시오.하지만 두 번째 단락을 따르지 않습니다 ( 가 정의되고 가 계산되는 방법을 설명합니다 ). 도움을 주시면 감사하겠습니다.G|x지|엑스G|xdY/dP디와이/디피dY/dP 신뢰도와 예측 대역의 계산은 상당히 표준입니다. 프리즘이 비선형 회귀의 예측 및 신뢰 구간을 계산하는 방법에 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.