통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
회귀를 사용하여 하나의 계수를 수정하고 다른 계수를 맞추는 방법
과 같은 특정 계수를 수동으로 수정 한 다음 모델에 을 유지하면서 계수를 다른 모든 예측 변수에 .β 1 = 1.0β1= 1.0β1=1.0\beta_1=1.0β1= 1.0β1=1.0\beta_1=1.0 R을 사용하여 어떻게 이것을 할 수 있습니까? glmnet가능하면 LASSO ( ) 와 협력하고 싶습니다 . 또는 어떻게이 계수를 특정 범위 (예 : 제한 할 수 있습니까?0.5 ≤ β1≤ …


2
실제 네트워크 / 그래프의 모든 에지가 통계적으로 우연히 발생할 가능성이 높다는 것은 무엇을 의미합니까?
이 백서에 요약 된 백본 네트워크 추출 방법을 사용하고 있습니다 : http://www.pnas.org/content/106/16/6483.abstract 기본적으로 저자는 그래프의 각 가장자리에 대해 가장자리가 우연히 발생할 수있는 확률을 생성하는 통계 기반 방법을 제안합니다. 나는 전형적인 통계적 유의성 컷오프 0.05을 사용합니다. 이 방법을 여러 실제 네트워크에 적용 해 왔으며 흥미롭게도 일부 네트워크는 그다지 중요하지 않습니다. 이것이 …

1
2 백분위 수를 사용하여 로그 정규 분포에 대한 평균 및 표준 편차를 계산하는 방법
로그 정규 분포에 대한 2 백분위 수의 평균 및 표준 편차를 계산하려고합니다. X = mean + sd * Z평균 및 sd를 사용 하고 풀고 정규 분포를 계산하는 데 성공했습니다 . 대수 정규 분포에 대해 같은 일을하려고 할 때 방정식이 빠진 것 같습니다. 위키 백과를 보고 사용하려고 ln(X) = mean + …
11 r  lognormal 

2
왜 종단면 변화를 추론 / 예측하기 위해 단면 데이터를 사용하는 것이 나쁜가?
나는 존재하기를 희망하는 논문을 찾고 있지만 그것이 있는지 모른다. 종단면 변화를 추론 / 예측하기 위해 단면 데이터를 사용하는 것이 왜 나쁜 것일 수 있는지에 대한 일련의 사례 연구 및 / 또는 확률 이론의 논거가 될 수 있습니다 (즉, 반드시 그런 것은 아니지만 가능할 수 있음). 영국에서 부유 한 사람들이 더 …


2
T- 분포 된 랜덤 변수의 제곱의 합의 분포
꼬리 지수가 인 T 분포 랜덤 변수의 제곱합의 분포를보고 있습니다. X가 rv 인 경우, 의 푸리에 변환 인 는 컨볼 루션 앞의 제곱에 대한 솔루션을 제공합니다 . αα\alphaX2X2X^2F(t)F(t)\mathscr{F}(t)F(t)nF(t)n\mathscr{F}(t)^nF(t)=∫∞0exp(itx2)⎛⎝⎜⎜⎜(αα+x2)α+12α−−√ B(α2,12)⎞⎠⎟⎟⎟dxF(t)=∫0∞exp⁡(itx2)((αα+x2)α+12α B(α2,12))dx\mathscr{F}(t)=\int_0^{\infty } \exp \left(i\, t\, x^2\right)\left(\frac{\left(\frac{\alpha }{\alpha +x^2}\right)^{\frac{\alpha +1}{2}} }{\sqrt{\alpha }\ B\left(\frac{\alpha }{2},\frac{1}{2}\right)}\right) \, \mathrm{d}x 함께 , 용액에 대해 푸리에 역변환 …

4
로지스틱 회귀 및 변곡점
이진 결과와 일부 공변량을 가진 데이터가 있습니다. 로지스틱 회귀를 사용하여 데이터를 모델링했습니다. 간단한 분석만으로도 특별한 것은 없습니다. 최종 결과는 특정 공변량에 대한 확률이 어떻게 변하는 지 보여주는 선량-반응 곡선이어야합니다. 이 같은: 우리는 로지스틱 회귀 분석을 선택한 내부 검토 자 (순수 통계 학자 아님)로부터 비판을 받았습니다. 로지스틱 회귀 분석은 확률 척도에서 …

1
군집 검증에 대한 정보 변형 (VI) 지표의 직관은 무엇입니까?
나와 같은 비 통계학 자의 VI경우 Marina Melia " 클러스터링 비교-정보 기반 거리 "(2007 년 저널)에 의해 관련 논문을 읽은 후에도 메트릭 (정보 변형) 아이디어를 포착하기가 매우 어렵습니다 . 사실, 많은 클러스터링 용어에 익숙하지 않습니다. 아래는 MWE이며 사용되는 다른 메트릭에서 출력이 무엇을 의미하는지 알고 싶습니다. R에 동일한 순서로 두 개의 …

2
중심 검열 된 정상 표본의 분산 추정
나는 작은 샘플 (얻을 수있는 프로세스 일반적으로-배포 한 N 내가 분산을 추정하는 데 사용할 것을 일반적으로 10 ~ 30). 그러나 종종 샘플이 너무 가까워서 중심 근처의 개별 지점을 측정 할 수 없습니다. 나는 우리가 순서가있는 샘플을 사용하여 효율적인 추정량을 구성 할 수 있다는이 모호한 이해를 가지고있다. 5 어느 쪽 꼬리에서나, …

1
lm.ridge 및 glmnet 사용시 릿지 회귀 결과가 다름
나는 최고의 변수 사용했다 R. I에서 능선 회귀를 사용하여 회귀 모델의 솔루션을 찾기 위해 일부 데이터를 적용 lm.ridge하고 glmnet(언제 alpha=0),하지만 결과는 특히 매우 다르다 lambda=0. 두 모수 추정값이 동일한 값을 가지고 있다고 가정합니다. 그래서, 여기서 무엇이 문제입니까? 친애하는

1
상관 관계가없는 배포는 독립성을 의미합니까?
통계에서 명예로운 알림은 "무관심은 독립성을 의미 하지 않습니다 "입니다. 일반적으로이 리마인더는 "두 가지 변수가 함께 정상적으로 분포 되어있을 때 상관 관계가 독립성을 암시하는" 심리적 진정 (그리고 과학적으로 올바른) 진술로 보충됩니다 . 나는 행복한 예외의 수를 1 개에서 2 개로 늘릴 수 있습니다. 두 변수가 베르누이 분포 일 때 다시 상관 …

2
일반화 선형 혼합 모델 : 진단
임의의 가로 채기 로지스틱 회귀 분석 (반복 된 측정으로 인해)이 있으며 특이 치 및 영향력있는 관측에 관한 진단을하고 싶습니다. 눈에 띄는 관측치가 있는지 알아보기 위해 잔차를 살펴 보았습니다. 그러나 나는 또한 Cook의 거리 또는 DFFITS와 같은 것을보고 싶습니다. Hosmer와 Lemeshow (2000)는 상관 된 데이터에 대한 모델 진단 도구가 없기 때문에 …

5
연속 랜덤 변수가 고정 소수점을 가정 할 확률
연속 랜덤 변수에 대한 확률 밀도 함수가 로 정의 된 입문 통계 클래스에 있습니다. 의 적분을 이해 하지만 연속 임의 변수의 직관으로이를 수정할 수는 없습니다. X가 열차가 도착하는 시간 t에서 분 수와 같은 임의 변수라고 가정하십시오. 기차가 정확히 5 분 후에 도착할 확률을 어떻게 계산합니까? 이 확률은 어떻게 제로가 될 …

1
다른 테스트 결과를 기반으로 가설 테스트 수행에 대한 논문
p- 값을 해석하기 어렵 기 때문에 다른 통계 테스트의 결과를 기반으로 통계 테스트를 선택하는 것은 문제가있는 것으로 잘 알려져 있습니다 (예 : 다른 결과에 따라 통계 테스트 선택 (예 : 정규성) ) . 그러나 이것은 많은 응용 분야에서 여전히 표준 관행이며 일반적으로 응용 논문에서 눈에 띄거나 논의되지 않는 것 같습니다. …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.