통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


3
차원의 기계 학습 저주가 설명 되었습니까?
차원의 저주를 이해하는 데 어려움을 겪고 있습니다. 구체적으로, scikit-learn파이썬 에서 튜토리얼 을 수행하는 동안 그것을 발견했습니다 . 누군가 아래를 더 간단한 방법으로 설명해 주시겠습니까? 가장 오랜 시간 동안 이해하려고했지만 효율적인 KNN 추정기를 달성하기 위해 많은 훈련 예를 계산 한 결과를 이해할 수 없습니까? 설명은 다음과 같습니다. 추정기가 효과적이기 위해서는 주변 …

1
비대칭 제안서 배포를 통한 대도시 해 스팅 이해
모델의 매개 변수를 추정하기위한 코드를 작성하기 위해 Metropolis-Hastings 알고리즘을 이해하려고 노력했습니다 (예 : f(x)=a∗xf(x)=a∗xf(x)=a*x ). 참고 문헌에 따르면 Metropolis-Hastings 알고리즘에는 다음 단계가 있습니다. 생성 Yt∼q(y|xt)Yt∼q(y|xt)Y_t \sim q(y|x^t) Xt+1={Yt,xt,with probabilityρ(xt,Yt),with probability1−ρ(xt,Yt),Xt+1={Yt,with probabilityρ(xt,Yt),xt,with probability1−ρ(xt,Yt),X^{t+1}=\begin{cases} Y^t, & \text{with probability} \quad \rho(x^t,Y_t), \\ x^t, & \text{with probability} \quad 1-\rho(x^t,Y_t), \end{cases} ρ(x,y)=min(f(y)f(x)∗q(x|y)q(y|x),1)ρ(x,y)=min(f(y)f(x)∗q(x|y)q(y|x),1)\rho(x,y)=\min \left( \frac{f(y)}{f(x)}*\frac{q(x|y)}{q(y|x)},1 \right) …

1
랜덤 포레스트 및 예측
Random Forest의 작동 방식을 이해하려고합니다. 나는 나무가 어떻게 만들어지는 지에 대해 이해하고 있지만 랜덤 포레스트가 가방 밖에서 어떻게 예측을하는지 이해할 수 없습니다. 누구든지 간단한 설명을 해 주시겠습니까? :)

3
비율 차이에 대한 신뢰 구간
두 비율의 차이에 대한 신뢰 구간을 올바르게 계산했는지 알려줄 수 있는지 궁금합니다. 표본 크기는 34이며 그 중 19 개는 암컷이고 15 개는 수컷입니다. 따라서 비율 차이는 0.1176471입니다. 차이가 -0.1183872와 0.3536814 사이의 95 % 신뢰 구간을 계산합니다. 신뢰 구간이 0을 통과 할 때 차이는 통계적으로 유의하지 않습니다. 아래는 R로 작업 한 …

1
회귀 분석의 비율, 즉 Kronmal에 대한 질문
최근 무작위로 탐색하는 질문으로 인해 몇 년 전에 회귀 모형의 비율 사용에 대해 경고하면서 교수 중 한 명이 직접 의견을 떠올리게되었습니다. 그래서 나는 이것에 대해 읽기 시작하여 결국 Kronmal 1993로 이어졌습니다. 나는 이것을 모델링하는 방법에 대한 그의 제안을 올바르게 해석하고 있는지 확인하고 싶습니다. : 종속 독립 측에서도 같은 분모 비율로 …


2
동전 뒤집기, 의사 결정 프로세스 및 정보 가치
다음과 같은 설정을 상상해보십시오. 동전 2 개, 공정한 것으로 보장 되는 동전 A , 공정하거나 아닐 수도있는 동전 B가 있습니다. 당신은 100 코인 플립을하도록 요청 받았으며, 당신의 목표는 헤드 수 를 최대화하는 것입니다 . 코인 B에 대한 당신의 이전 정보는 동전이 3 번 뒤집히고 1 헤드를 산출했다는 것입니다. 결정 규칙이 …

1
선형 모형에서 R- 제곱 일반화 된 선형 모형에서 이탈?
이 질문에 대한 내 맥락은 다음과 같습니다 survey. 가중 데이터와 패키지를 사용할 때 R에서 일반 최소 제곱 회귀를 실행할 수 없습니다 . 여기서 우리는 svyglm()대신 일반화 된 선형 모델을 실행하는 을 사용해야 합니다. OLS와 lm()함수를 통해 R 제곱 값을 계산합니다. 해석은 이해합니다. 그러나 svyglm()이것을 계산하지 않고 대신 Deviance를 제공합니다. 인터넷을 …


4
kNN의 관계, 가중치 및 투표 처리
kNN 알고리즘을 프로그래밍 중이며 다음을 알고 싶습니다. 타이 브레이크 : 과반수 투표에서 확실한 승자가 없으면 어떻게됩니까? 예를 들어 k 개의 가장 가까운 이웃이 다른 클래스에서 왔거나 k = 4 인 경우 A 클래스에서 2 명의 이웃이 있고 B 클래스에서 2 명의 이웃이 있습니까? 거리가 같은 이웃이 더 많아서 정확히 k …

2
정규 분포 분포 랜덤 변수 중 가장 큰 것은 무엇입니까?
임의의 변수 있습니다. 평균 분포는 평균 이고 분산 입니다. RVS 일반적으로 평균 분산 이고 분산이 . 모든 것이 서로 독립적입니다.X 0 μ > 0 1 X 1 , … , X n 0 1X0,X1,…,XnX0,X1,…,XnX_0,X_1,\dots,X_nX0X0X_0μ>0μ>0\mu>0111X1,…,XnX1,…,XnX_1,\dots,X_n000111 하자 하는 경우를 의미 ,이 중 가장 큰 즉, . \ Pr [E] 계산하거나 추정하고 싶습니다 …

2
분류 및 회귀 트리 뒤의 수학
누구든지 CART 분류의 일부 수학을 설명 할 수 있습니까? 두 가지 주요 단계가 어떻게 진행되는지 이해하려고합니다. 예를 들어 데이터 세트에 대해 CART 분류기를 훈련시키고 예측 데이터를 표시하기 위해 테스트 데이터 세트를 사용했지만 다음과 같습니다. 나무의 초기 뿌리는 어떻게 선택됩니까? 각 가지가 왜 그리고 어떻게 형성됩니까? 15 개의 열과 23 개의 …

2
칼만 필터는 언제 단순한 이동 평균보다 더 나은 결과를 제공합니까?
최근에 임의의 속도와 가속도로 입자 위치를 측정하는 간단한 예에서 칼만 필터를 구현했습니다. 칼만 필터가 잘 작동한다는 것을 알았지 만, 이것과 이동 평균의 차이점이 무엇인지 스스로에게 물었습니다. 이동 평균이 칼만 필터보다 성능이 우수한 약 10 개의 샘플 창을 사용하는 경우 칼만 필터를 사용하는 경우의 예를 찾으려고한다면 이동 평균을 사용하는 것보다 유리합니다. …

2
많은 셀의 주파수가 5 미만인 경우 카이-제곱 검정의 적용 가능성
동료의 지원 (독립 변수)과 작업 만족도 (의존 변수) 사이의 연관성을 찾기 위해 카이 제곱 테스트를 적용하고 싶습니다. 동료의 지원은 지원 범위에 따라 네 그룹으로 분류됩니다. 1 = 매우 적은 범위, 2 = 일부, 3 = 대부분, 4 = 매우 업무 만족도는 두 가지로 분류됩니다 : 0 = 만족 및 1 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.