통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
선택한 가양 성 / 거짓 음수 오류율과 기본 비용 비율을 엄격하게 정당화하는 방법은 무엇입니까?
문맥 사회 과학자 및 통계 학자 그룹 ( Benjamin et al., 2017 )은 최근 "통계적 유의성"을 결정하기위한 임계 값으로 사용 된 전형적인 위양성 비율 ( = .05)을보다 보수적 인 임계 값으로 조정해야 한다고 제안했습니다. ( = .005). 경쟁하는 사회 과학자와 통계 학자 그룹 ( Lakens et al., 2018 )은이 또는 …

1
배치 정규화를 통한 역 전파의 매트릭스 형태
배치 정규화 는 심층 신경망에서 상당한 성능 향상으로 인정되었습니다. 인터넷에 많은 자료가 활성화별로이를 구현하는 방법을 보여줍니다. 나는 이미 행렬 대수를 사용하여 backprop를 구현했으며, 고밀도 언어 ( Rcpp고밀도 행렬 곱셈 에 (그리고 결국 GPU)에 의존하는 동안 )에서 모든 것을 추출하고 for-loops를 사용하면 코드가 느려질 것입니다 대단한 고통에 더해 배치 정규화 함수는 …

5
XXX 및YYY 는 독립적으로 분포 된 랜덤 변수입니다. 여기서X∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)} 및Y∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right). Z=(2Y−1)의 분포는√Z=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X ? 공동 밀도 (X,Y)(X,Y)(X,Y) 에 의해 주어진다 에프엑스, Y( x , y) = f엑스( x ) f와이( y) = 전자− x2엑스n - 12− 12n - 12Γ ( n - 12)⋅ y엔2− 2( 1 − y)엔2− 2B ( …

3
Bertrand의 박스 역설에 대한 Monte Carlo 시뮬레이션을 프로그래밍하는 방법?
다음 문제점이 Mensa International Facebook 페이지에 게시되었습니다 : \quad\quad\quad\quad\quad\quad\quad\quad 게시물 자체는 1000 개 이상의 댓글을 받았지만 이것이 Bertrand의 상자 역설 이며 답은 이므로 토론에 대한 자세한 내용은 . 여기서 내가 관심을 갖는 것은 Monte Carlo 접근법을 사용하여이 문제에 어떻게 대답 하는가? 알고리즘은이 문제를 어떻게 해결합니까?2삼23\frac23 내 시도는 다음과 같습니다. 과 …

3
연구원 1은 1000 회귀 회귀, 연구원 2는 1 회 회귀, 둘 다 동일한 결과를 얻습니다. 서로 다른 추론을해야합니까?
한 연구원이 데이터 세트를 탐색하고 1000 개의 서로 다른 회귀 분석을 실행한다고하는데 그 중 하나의 흥미로운 관계를 발견했다고 상상해보십시오. 이제 같은 데이터를 가진 다른 연구원 이 단 한 번의 회귀 만 실행 한다고 상상해보십시오 . 다른 연구원이 1000 번의 회귀를 찾은 것과 같은 결과 인 것으로 나타났습니다. 연구원 2는 연구원 …

1
인가
동료가 반응 변수를 1 의 거듭 제곱으로 높여서 변수를 변환 한 후 일부 데이터를 분석하려고합니다. (즉,y0.125).1818\frac18와이0.125y0.125y^{0.125} 나는 이것에 불편하지만, 이유를 분명히하기 위해 고군분투하고있다. 나는이 변화에 대한 어떤 기계적인 근거도 생각할 수 없다. 전에도 본 적이 없으며, 제 1 종 오류율이나 그 이상이 부풀려 질까 걱정됩니다. 그러나 이러한 우려를지지 할만한 것은 …

1
일반화 된 가산 모델 (GAM), 상호 작용 및 공변량
예측을위한 여러 가지 도구를 살펴 보았으며이 목표를 달성 할 수있는 가장 일반적인 잠재력을 가진 GAM (Generalized Additive Models)을 발견했습니다. GAM은 훌륭합니다! 복잡한 모델을 간결하게 지정할 수 있습니다. 그러나 동일한 간결함은 특히 GAM이 상호 작용 항과 공변량을 어떻게 생각하는지에 관해 혼란을 유발합니다. y몇 개의 가우시안에 의해 혼동 된 단조 함수와 약간의 …
12 r  modeling  gam  mgcv 

5
선형 회귀는 더 이상 사용되지 않습니까? [닫은]
폐쇄되었습니다 . 이 질문은 의견 기반 입니다. 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 이 게시물 을 편집 하여 사실과 인용으로 답변 할 수 있도록 질문을 업데이트하십시오 . 휴일 2 년 전 . 나는 현재 선형 회귀 수업에 있지만, 내가 배우고있는 것이 더 이상 현대 통계 나 기계 학습과 관련이 …

2
보여주는 구성 예제
어떻게 해당하는 확률 분포의 일례 구축 가정 보유 ?E(1X)=1E(X)E(1X)=1E(X)\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)}P(X≠0)=1P(X≠0)=1\mathbb{P}(X\ne0)=1 양수의 RV 대한 Jensen의 불평등에 따른 불평등 은 ( 경우 역 불평등 ). 이는 매핑이 대해 볼록 하고 대해 오목하기 때문 입니다. Jensen의 불평등의 평등 조건에 따라 필요한 평등을 유지하기 위해 분포가 퇴화되어야한다고 생각합니다. 경우 평등 보유 일반의 경우는 물론이고 여기 …

2
로지스틱 회귀 및 가능성 이해
로지스틱 회귀의 모수 추정 / 훈련은 실제로 어떻게 작동합니까? 지금까지 가지고있는 것을 넣어 보도록하겠습니다. x의 값에 따른 확률의 형태로 로지스틱 함수의 출력은 y입니다. P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1-P(y=1|x)=1-{1\over1+e^{-\omega^Tx}} 한 차원에서 소위 홀수는 다음과 같이 정의됩니다. p(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1xp(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1x{{p(y=1|x)}\over{1-p(y=1|x)}}={{p(y=1|x)}\over{p(y=0|x)}}=e^{\omega_0+\omega_1x} 이제 log선형 형태로 W_0 및 W_1을 얻는 함수를 추가합니다 . Logit(y)=log(p(y=1|x)1−p(y=1|x))=ω0+ω1xLogit(y)=log(p(y=1|x)1−p(y=1|x))=ω0+ω1xLogit(y)=log({{p(y=1|x)}\over{1-p(y=1|x)}})=\omega_0+\omega_1x 이제 문제 부분 으로 우도 사용 …

1
GAM 맞춤 요약
우리가 GAM에 맞는다면 : gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) College패키지 안에서 찾을 수있는 데이터 셋을 사용합니다 ISLR. 이제이 맞춤의 요약을 찾으면 다음을 …
12 anova  gam 

1
스플라인 또는 분수 다항식을 사용할 때 누락 된 데이터를 어떻게 처리 할 수 ​​있습니까?
Patrick Royston과 Willie Sauerbrei의 연속 변수 모델링을위한 분수 다항식을 기반으로 한 회귀 분석에 대한 다변량 모델 구축 : 실용적인 접근 방식을 읽고 있습니다. 지금까지 나는 감동했으며 이전에는 고려하지 않은 흥미로운 접근법입니다. 그러나 저자는 누락 된 데이터를 처리하지 않습니다. 실제로, p. 17 그들은 누락 된 데이터는 "많은 추가적인 문제를 야기시킨다. 여기서는 …

3
오늘날 Usain Bolt보다 빠른 사람이 있습니까?
편집 : 나는 샘플 통계가 주어진 주어진 인구에서 "참"최대 가능성을 결정하는 기술적 문제와 방법론에 더 관심이 있습니다. 명백히 미묘한 기록 설정 대시 시간에서 Mr. Bolt보다 빠른 러너의 가능성을 추정하는 데 문제가 있습니다. 이것이 사실이 아니라고 상상함으로써 유머러스. 우사 인 볼트 (Usain Bolt)는 100m 대시에서 가장 빠른 사람 측정입니다. 그러나 소수의 …

3
PCA 최적화는 볼록합니까?
PCA (Principal Component Analysis)의 목적 함수는 L2 규범의 재구성 오류를 최소화하는 것입니다 ( 여기 섹션 2.12 참조) . 또 다른 관점은 투영의 분산을 최대화하려고 시도하는 것입니다. 또한 PCA의 목적 함수는 무엇입니까? ? ). 내 질문은 PCA 최적화 볼록한 것입니까? (나는 여기서 몇 가지 토론을 찾았 지만 누군가가 이력서에 대한 좋은 …

2
GLM 및 GAM의 스플라인
스플라인은 GLM 모델이 아닌 GAM 모델에서만 사용할 수 있다는 것이 잘못입니까? 나는 이것을 잠시 들었고, 이것이 단지 오해인지 또는 그것에 대한 진실이 있는지 궁금합니다. 그림은 다음과 같습니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.