통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
다변량 회귀 전의 일 변량 회귀 점은 무엇입니까?
나는 현재 우리가 작은 데이터 세트를 가지고 있고 결과에 대한 치료의 인과 관계 영향에 관심이있는 문제에 대해 연구하고 있습니다. 고문은 각 예측 변수에 대해 일 변량 회귀 분석을 수행하고 결과를 반응으로, 처리 할당을 반응으로 수행하도록 지시했습니다. 즉, 한 번에 하나의 변수로 회귀를 맞추고 결과 테이블을 만들어야합니다. 나는 "우리가 왜 이것을해야합니까?"라고 …

1
개별 표본의 확률이 0 일 때 MLE가 왜 의미가 있습니까?
이것은 오래된 통계를 검토하는 동안의 이상한 생각이며 어떤 이유로 든 대답을 생각할 수없는 것 같습니다. 연속 PDF는 주어진 범위 내에서 관찰 값의 밀도를 알려줍니다. 즉, 예를 들어, 엑스~ N( μ , σ2)X∼N(μ,σ2)X \sim N(\mu,\sigma^2) 이면, 실현이 ㅏaa 와 비bb 사이에있을 확률 은 간단히 ∫비ㅏϕ ( x ) d엑스∫abϕ(x)dx\int_a^{b}\phi(x)dx 여기서 ϕϕ\phi …

8
비논리적 설문 응답을 처리하는 방법
샘플 아티스트에게 설문 조사를 제출했습니다. 질문 중 하나는 예술 활동, 정부 지원, 개인 연금, 예술과 관련이없는 활동에 의해 도출 된 소득의 백분율을 나타내는 것이었다. 개인의 약 65 %가 백분율의 합이 100이라고 대답했습니다. 다른 사람은 그렇지 않습니다. 예를 들어, 자신의 예술 활동으로 인해 수입의 70 %와 소득 정부에서 60 %가 대답 …
13 survey  bias 


4
최대 a-posteriori 추정이 가능한 경우 MCMC 기반 방법이 적절합니까?
많은 실제 응용 분야에서, MCMC 기반 방법은 사후가 분석적 임에도 불구하고 매개 변수를 추정하는 데 사용됩니다 (예를 들어, 선행 기술이 공액 이었기 때문에). 저에게는 MCMC 기반 견적 도구보다는 MAP 견적 도구를 사용하는 것이 더 합리적입니다. MCMC가 왜 분석 후부에서 여전히 적절한 방법인지 지적 할 수 있습니까?

2
올가미와 비교하여 최상의 서브 세트 선택이 선호되지 않는 이유는 무엇입니까?
통계 학습 서적의 요소에서 최상의 하위 집합 선택에 대해 읽고 있습니다. 3 개의 예측 변수 이 있으면 2 3 = 8 부분 집합을 만듭니다 .엑스1, x2, x삼x1,x2,x3x_1,x_2,x_32삼= 823=82^3=8 예측 변수가없는 부분 집합 예측 변수가 x 1 인 부분 집합엑스1x1x_1 예측 변수가 x 2 인 부분 집합엑스2x2x_2 예측 변수 x 3의 …


1
제어 변수에 대한 그룹을 비교할 때 동등성 검정을 사용해야합니까?
치료와 결과를 고려한 많은 논문들에서, 의미 집단에 대한 성가의 테스트와 "그룹은 대체로 비슷했습니다. XXXXX와 큰 차이가 없었습니다. 표 "를 참조하십시오. 따라서 명확한 목표는 다른 치료에 할당 된 그룹이 유사하다는 것을 보여주는 것입니다. 그러나 이것은 "널을 받아 들일 수"있고 우리가해야 할 (또는 요구되는) 동등성 테스트라고 생각합니다. 이는 무작위 시험 또는 관찰 …


2
베이지안 딥 러닝이란 무엇입니까?
베이지안 딥 러닝이란 무엇이며 기존 베이지안 통계 및 전통적인 딥 러닝과 어떤 관련이 있습니까? 주요 개념과 수학은 무엇입니까? 파라 메트릭이 아닌 베이지안 통계라고 말할 수 있습니까? 주요 작업과 현재 주요 개발 및 응용 프로그램은 무엇입니까? 추신 : Bayesian Deep Learning은 많은 주목을 받고 있습니다. NIPS 워크숍을 참조하십시오.

5
범위는 0에서 1 사이이며 그 사이에 피크가 있습니까?
배포판이 있습니까 아니면 다른 배포본에서 작업하여 아래 이미지와 같은 배포판을 만들 수 있습니까 (나쁜 도면에 대한 사과)? 여기서 피크가 어디에 있어야하는지에 대한 숫자 (예 : 0.2, 0.5 및 0.9)와 함수를 더 넓게 또는 덜 넓게하는 표준 편차 (시그마)를 제공합니다. PS : 주어진 숫자가 0.5 일 때 분포는 정규 분포입니다.

2
모수 추정에 관한 문제
하자 및 것을 네 랜덤 변수하여야 . 여기서 은 알 수없는 매개 변수입니다. 또한 , 라고 가정하십시오그렇다면 어느 것이 사실입니까?Y1,Y2,Y3Y1,Y2,Y3Y_1,Y_2,Y_3Y4Y4Y_4E(Y1)=θ1−θ3; E(Y2)=θ1+θ2−θ3; E(Y3)=θ1−θ3; E(Y4)=θ1−θ2−θ3E(Y1)=θ1−θ3; E(Y2)=θ1+θ2−θ3; E(Y3)=θ1−θ3; E(Y4)=θ1−θ2−θ3E(Y_1)=\theta_1-\theta_3;\space\space E(Y_2)=\theta_1+\theta_2-\theta_3;\space\space E(Y_3)=\theta_1-\theta_3;\space\space E(Y_4)=\theta_1-\theta_2-\theta_3 V a r ( Y i ) = σ 2 i = 1 , 2 , 3 , 4.θ1,θ2,θ3θ1,θ2,θ3\theta_1,\theta_2,\theta_3Var(Yi)=σ2Var(Yi)=σ2Var(Y_i)=\sigma^2i=1,2,3,4.i=1,2,3,4.i=1,2,3,4. A. 는 …

1
ROC 곡선이 서로 교차 할 때 두 모델 비교
둘 이상의 분류 모델을 비교하는 데 사용되는 일반적인 방법 중 하나는 ROC 곡선 (AUC) 아래 면적을 성능을 간접적으로 평가하는 방법으로 사용하는 것입니다. 이 경우 AUC가 큰 모델은 일반적으로 AUC가 작은 모델보다 성능이 우수한 것으로 해석됩니다. 그러나 Vihinen, 2012 ( https://www.ncbi.nlm.nih.gov/pmc/articles/PMC3303716/ )에 따르면 두 곡선이 서로 교차하면 이러한 비교는 더 이상 …

2
CLR (중앙 로그 비율 변환)을 사용하여 PCA에 대한 데이터를 준비 할 수 있습니까?
스크립트를 사용하고 있습니다. 핵심 레코드입니다. 주어진 깊이 (열의 첫 번째 열)에 대한 열의 다른 원소 구성을 보여주는 데이터 프레임이 있습니다. PCA를 수행하고 싶습니다. 선택해야하는 표준화 방법이 혼란 스럽습니다. clr()귀하를 위해 데이터를 준비하기 위해 를 사용한 사람이 prcomp()있습니까? 아니면 내 솔루션을 방해합니까? 에서 scale 속성을 사용하는 것 외에도 함수를 clr()사용하기 전에 …

2
경제학 연구자들이 왜 이항 반응 변수에 선형 회귀를 사용합니까?
최근에 나는 경제학 (나는 익숙하지 않은 분야)에 관한 몇 가지 논문을 읽어야했다. 내가 주목 한 한 가지는 응답 변수가 이진 일지라도 OLS를 사용하여 피팅 된 선형 회귀 모델은 어디에나 있다는 것입니다. 내 질문은 따라서 : 경제학 분야에서 로지스틱 회귀와 같이 왜 선형 회귀가 선호됩니까? 이것은 단순히 일반적인 관행입니까 아니면 적극적으로 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.