통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
'bagplot'또는 'bivariate boxplot'이란 무엇입니까?
상자 그림 의 다차원 (여기서는 이변 량) 버전을 소개 하는 종이 를 찾았 습니다. 그 bagplot은 정확히 무엇입니까? 정점을 기반으로 일련의 중첩 다각형을 볼 수 있는데, 그 중 하나는 백 플롯으로 선언됩니다. 중첩 다각형 빌딩의 아이디어는 무엇입니까? 백 플롯 (중앙 또는 평균 포인트 수를 보유)은 어느 다각형입니까? 백 플롯의 모서리에 …

2
부트 스트랩 가설 검정에서 귀무 가설하에 데이터를 다시 샘플링해야하는 이유는 무엇입니까?
부트 스트랩 방법을 가설 테스트에 간단하게 적용하는 것은 부트 스트랩 샘플에서 반복적으로 계산 하여 테스트 통계 의 신뢰 구간을 추정하는 것입니다 (부트 스트랩 에서 샘플링 된 통계 이라고 함). ). 가정 된 모수 (보통 0)이 의 신뢰 구간을 벗어나 면 거부 합니다. θ ^ θ * H0θ0 ^ θ *θ^θ^\hat{\theta}θ^θ^\hat{\theta}θ∗^θ∗^\hat{\theta^*}H0H0H_0θ0θ0\theta_0θ∗^θ∗^\hat{\theta^*} …

2
오메가 vs. 알파 신뢰성
누군가가 오메가와 알파 신뢰성의 주요 차이점이 무엇인지 설명 할 수 있는지 궁금합니다. 다음 그림과 같이 오메가 안정성은 계층 적 요인 모델을 기반으로하며 알파는 평균 항목 간 상관 관계를 사용합니다. 내가 이해하지 못하는 것은 어떤 조건에서 오메가 신뢰성 계수가 알파 계수보다 높고 그 반대도 마찬가지입니까? 하위 요소와 변수 사이의 상관 관계가 …

2
포아송 회귀 가정 및 R에서 검정을 테스트하는 방법
데이터에 가장 적합한 회귀 분석을 테스트하고 싶습니다. 내 종속 변수는 개수이며 많은 0이 있습니다. 그리고 사용할 모델 및 패밀리 (poisson 또는 quasipoisson 또는 0으로 부풀린 poisson 회귀)를 결정하고 가정을 테스트하는 방법을 결정하는 데 도움이 필요합니다. 포아송 회귀 : 내가 이해하는 한, 종속 변수 평균 = 분산이라는 강한 가정이 있습니다. 이것을 …

1
ggplot 또는 타원 패키지로 95 % CI 타원을 플로팅 할 때 다른 결과 얻기
protoclust{protoclust}내 데이터를 분류하고 클래스별로 색상을 지정하고 각 클래스에 대해 95 % 신뢰 구간에 대해 타원을 겹치는 데 사용되는 각 변수 쌍에 대해 스 캐터 플롯을 작성 하여 클러스터링 (으로 생성 ) 결과를 시각화하고 싶습니다 ( elipses-classes는 각 변수 쌍에서 겹칩니다). 타원 그리기를 두 가지 방법으로 구현했으며 결과 타원이 다릅니다! (첫 …

3
컴퓨터 시뮬레이션을 사용하여 대학원 수준의 통계 개념을 더 잘 이해
안녕하세요, 저는 통계학 대학원 과정을 수강하고 있으며 테스트 통계 및 기타 개념을 다루었습니다. 그러나 나는 종종 공식을 적용하고 물건이 어떻게 작동하는지에 대한 일종의 직관을 개발할 수 있지만, 아마도 모의 실험으로 연구를 백업하면 당면한 문제에 대해 더 나은 직관을 개발할 것이라는 느낌이 종종 듭니다. . 그래서, 우리가 수업에서 논의하는 일부 개념을 …

2
각 날짜에 대한 여러 관측치가 포함 된 시계열 작성
분기당 3 회 반복하여 10 년 동안 분기 별 샘플링 데이터 (동물 바이오 매스)에 시계열을 적용하려고합니다. 따라서 40 개의 날짜와 120 개의 총 관측치가 있습니다. 나는 Shumway와 Stoffer의 시계열 분석에서 SARIMA'a를 읽었으며 응용 프로그램뿐만 아니라 스키드 우드워드 등도 읽었습니다. al. 's Applied 시계열 분석, 그리고 내 이해는 각 모델이 시계열의 …
11 r  time-series 

1
이 데이터를 이항 glm에 대한 비율로 집계 할 수 있습니까?
우리는 60 명의 사람들에게 애틀랜타에 가능한 많은 식당 프랜차이즈를 나열하도록 요청했습니다. 전체 목록에는 70 개가 넘는 식당이 포함되었지만, 10 % 미만의 사람들이 언급 한 식당을 제거하여 45 명을 남겼습니다.이 45 명에 대해서는 프랜차이즈를 등록한 정보원의 비율을 계산하여 관심을 보였습니다. 이 비율을 프랜차이즈의 (로그 변환 된) 광고 예산 및 프랜차이즈가 된 …

2
회귀의 목적으로 예측 변수의 차원을 줄이는 이점은 무엇입니까?
기존의 회귀 기법에 비해 차원 축소 회귀 (DRR) 또는 감독 차원 축소 (SDR) 기법 의 적용 또는 장점은 무엇입니까 ( 차원 축소 없이)? 이러한 기술 클래스는 회귀 문제에 대한 특징 세트의 저 차원 표현을 찾습니다. 이러한 기술의 예에는 슬라이스 역 회귀, 주 헤 시안 방향, 슬라이스 평균 분산 추정, 커널 …

1
로지스틱 회귀 분석의 상한을 5-7 개의 데이터 포인트로 추정하는 방법은 무엇입니까?
y = β 1 형식의 데이터가 있습니다.y=β11+exp(β2+β3∗x)y=β11+exp⁡(β2+β3∗x)y = \frac{\beta_1}{1 + \exp(\beta_2 + \beta_3 * x)} . β1β1\beta_1~의 추정을β3β3\beta_3위해이 논문의 공식을 사용합니다 :John Fox-비선형 회귀 및 비선형 최소 제곱 이 논문에서,β1β1\beta_1은 데이터를보고 추정됩니다. 내가 그렇게하면 3 점 만 있어도 잘 작동합니다. 그로부터 나는 다른 두 사람을 계산할 수 있습니다. R의 nls …

5
텍스트 마이닝에 관한 좋은 책?
안녕하세요. 사례 연구를 통해 텍스트 마이닝 및 분류에 관한 좋은 책이 있는지 알고 싶었습니다. 그렇지 않다면 대중이 접근 할 수있는 서류 / 저널이있을 것입니다. 그들이 R로 그들의 예를 더 잘 설명한다면. 나는 단계별 매뉴얼을 찾지 않고 다양한 클래스의 문제에 대한 다양한 텍스트 마이닝 접근법의 장단점을 보여주는 것을 찾고 있습니다.

4
StackOverflow 평판 분포에서 Gini 지수를 계산하려고합니까?
SO Data Explorer를 사용하여 SO 평판 분포에서 Gini 지수를 계산하려고합니다. 내가 구현하려는 방정식은 다음과 같습니다 여기서, = 사이트의 사용자 수; = 사용자 일련 ID (1-1,225,000); = 사용자 평판 .지 ( S)) = 1n - 1( N + 1 - 2 ( ∑엔나는 = 1( n + 1 − i ) …
11 gini 

1
이 표본에 대해 (log-) 정규성을 가정 할 수 있습니까?
다음은 샘플에 대한 QQ 플롯입니다 (로그 Y 축에 주목). :n=1000n=1000n = 1000 whuber가 지적했듯이 이것은 기본 분포가 왼쪽으로 치우쳐 있음을 나타냅니다 (오른쪽 꼬리가 짧음). shapiro.testW=0.9718W=0.9718W = 0.97185.172⋅10−135.172⋅10−135.172\cdot10^{-13}H0:the sample is normal distributedH0:the sample is normal distributedH_0 : \text{the sample is normal distributed} 내 질문은 : (log-) 정상 성을 가정하여 추가 분석을 …

1
R에서 비례 배당률 가정없이 순서 로지스틱 회귀 분석에서 계수를 수정하는 방법은 무엇입니까?
비례 배당률 가정없이 R에서 순서 형 로지스틱 회귀 분석을 원합니다. 이 vglm()기능 R을 설정 하여 직접 수행 할 수 있음을 알고 있습니다 parallel=FALSE. 그러나 내 문제는이 회귀 설정에서 특정 계수 세트를 수정하는 방법입니다. 예를 들어, 종속 변수 가 이산적이고 서수이고 값 , 또는 취할 수 있다고 가정하십시오 . 회귀자가 X_ …
11 r  regression  logistic 

1
en 펠트 잔차
변수가 많은 Cox 비례 위험 모델에서 Schoenfeld 잔차가 변수 중 하나에 대해 평평하지 않은 경우 전체 모형이 무효화되거나 실적이 저조한 변수 만 무시 될 수 있습니까? 즉, 다른 변수에 대한 계수는 해석하지만 성능이 좋지 않은 변수에 대한 결과 계수는 해석하지 않습니다. Schoenfeld 잔차가 평평하지 않은 모델을 처리하는 몇 가지 표준 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.