통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
분류 작업에서 기능 선택이 중요한 이유는 무엇입니까?
기능 선택에 대해 배우고 있습니다. 모델 구축에 왜 이것이 중요하고 유용한 지 알 수 있습니다. 그러나지도 학습 (분류) 작업에 중점을 두겠습니다. 분류 작업에서 기능 선택이 중요한 이유는 무엇입니까? 피처 선택과지도 학습을위한 사용법에 관한 많은 문헌이 있지만, 이것은 당황합니다. 기능 선택은 버릴 기능을 식별하는 것입니다. 직관적으로, 일부 기능을 버리는 것은 자멸적인 …

3
공선 성을 탐지하기위한 다양한 접근 방식의 장점은 무엇입니까?
OLS 회귀 분석에서 공선 성이 문제인지 확인하고 싶습니다. 분산 인플레이션 요인과 조건 지수는 일반적으로 사용되는 두 가지 측정 방법이지만 각 방법의 장점 또는 점수가 무엇인지에 대해 명확한 것을 찾는 것이 어렵다는 것을 알고 있습니다. 수행 할 접근 방식 및 / 또는 적절한 점수를 나타내는 중요한 출처가 매우 유용합니다. 비슷한 질문이 …

1
지리적 좌표에서 커널 밀도 추정값을 계산하는 올바른 방법은 무엇입니까?
위도 및 경도 좌표 목록에서 2d 커널 밀도 추정값 (kde)을 계산해야합니다. 그러나 위도의 1 도는 경도의 1 도와 같은 거리가 아닙니다. 이는 개별 커널이 타원, 특히 적도에서 멀어 질수록 타원이된다는 것을 의미합니다. 제 경우에는 포인트가 모두 서로 가깝게 배치되어 평평한 지구로 변환하면 많은 문제가 발생하지 않습니다. 그러나 이것이 사실이 아닌 …

2
부분적으로“알 수없는”데이터로 분류
숫자 벡터를 입력으로 사용하고 클래스 레이블을 출력으로 제공하는 분류기를 배우고 싶다고 가정 해보십시오. 내 훈련 데이터는 많은 수의 입력-출력 쌍으로 구성됩니다. 그러나 일부 새 데이터를 테스트 할 때이 데이터는 일반적으로 부분적으로 만 완료됩니다. 예를 들어 입력 벡터의 길이가 100 인 경우 요소 중 30 개에만 값이 제공되고 나머지는 "알 수 …

1
우도 비 검정의``바람직한 ''통계적 특성은 무엇입니까?
가능성 비율 검정을 기반으로하는 방법을 완전히 갖춘 기사 를 읽고 있습니다. 저자는 한쪽 대안에 대한 LR 테스트는 UMP라고 말합니다. 그는 주장하면서 진행 "... [LR 테스트]가 가장 강력하게 균일하지 않다고하더라도 LR 테스트는 종종 바람직한 통계적 특성을 가지고 있습니다." 여기에 어떤 통계적 속성이 있는지 궁금합니다. 저자가 통과 한 사람들을 언급한다고 가정하면, 나는 …

1
통계 학자들은 실제 응용 작업에서 Jeffreys의 사전을 사용합니까?
대학원 통계 추론 수업에서 Jeffreys의 이전에 대해 배웠을 때 교수님들은 누군가가 그것을 사용하기보다는 역사적 이유로 대부분 흥미로워하는 것처럼 들었습니다. 그런 다음 베이지안 데이터 분석을 수행 할 때 Jeffreys의 사전 사용을 요청받지 않았습니다. 실제로 실제로 이것을 사용하는 사람이 있습니까? 그렇다면 (또는 그렇지 않은 경우) 왜 또는 왜 그렇지 않습니까? 일부 통계 …

2
가우스 프로세스에서 관측치 병합
회귀에 가우시안 프로세스 (GP)를 사용하고 있습니다. 내 문제에서 두 개 이상의 데이터 포인트 가 상대적으로 길이에 상대적으로 가깝습니다. 문제의 규모. 또한 관측에 소음이 심할 수 있습니다. 계산 속도를 높이고 측정 정확도를 높이려면 더 큰 길이의 예측에 관심이있는 한 서로 가까운 지점의 클러스터를 병합 / 통합하는 것이 자연스러워 보입니다.x⃗ (1),x⃗ (2),…x→(1),x→(2),…\vec{x}^{(1)},\vec{x}^{(2)},\ldots …


4
버스 대기열을 종료 할 것인지 아니면 확률 이론을 사용하여 대기 할 것인지 선택하는 방법은 무엇입니까?
나는 지금 얼마 동안 무언가를 생각 해왔고, 확률 이론에 능숙하지 않기 때문에 이것이이 질문을하기에 좋은 장소라고 생각했다. 이것은 대중 교통의 긴 줄에서 나에게 일어난 것입니다. 당신이 버스 정류장에 있고 버스 (또는 여러 버스)가 확실히 (하루 동안) 미래에 올 것이지만 정확한 순간을 알지 못한다고 가정하십시오. 버스가 5 분 안에 도착할 가능성을 …

2
가족 별 오류 경계 : 독립적 인 질문에 대한 다른 연구에서 데이터 세트를 재사용하면 여러 테스트 문제가 발생합니까?
연구팀이 주어진 데이터 세트에 대해 여러 가지 (가설) 테스트를 수행하는 경우 테스트가 독립적 인 경우에도 여러 테스트 (Bonferroni 등)에 대해 일종의 수정을 사용해야한다고 주장하는 문헌이 많이 있습니다. 내 질문은 이것입니다 : 동일한 논리가 동일한 데이터 세트에서 가설을 테스트하는 여러 팀에 적용됩니까? 다른 방법으로, 가족 별 오류 계산의 장벽은 무엇입니까? 연구원들이 …

1
모집단 평균이 알려진 경우 모집단의 분산 추정
를 사용하여 모집단의 분산을 추정 한다는 것을 알고 있습니다 . 주어진 직관은 우리의 추정 평균이 실제 일회성 조금 아마이었다 어디 칸 아카데미에서 비디오를 기억 때문에 거리 우리가 나눌 수 있도록 실제로 더 큰 것 이하 ( 대신에 ) 더 큰 값을 얻으려면 더 나은 추정치를 얻습니다. 그리고 어딘가에서 읽은 것을 …
11 variance  sample 

1
PyMC3에서 베이지안 모델 선택
PyMC3을 사용하여 데이터에서 베이지안 모델을 실행하고 있습니다. 나는 Bayesian 모델링에 익숙하지 않지만 이 사이트의 일부 블로그 게시물 , Wikipedia 및 QA 에 따르면 Bayes factor 및 BIC 기준을 사용하여 내 데이터를 가장 잘 나타내는 모델을 선택할 수있는 유효한 접근 방법 인 것 같습니다 (생성하는 모델) 내 데이터). Bayes 계수를 계산하려면 …

1
GLM에 몇 개의 배포판이 있습니까?
교과서에서 GLM이 5 개의 분포 (즉, 감마, 가우시안, 이항, 역 가우시안 및 포아송)로 설명 된 여러 위치를 식별했습니다. 이것은 또한 R의 패밀리 함수에서 예시됩니다. 때때로 추가 배포가 포함 된 GLM에 대한 언급을 접할 수도 있습니다 ( 예 ). 누군가이 5 가지가 왜 특별하거나 항상 GLM에 있는지 설명 할 수 있습니까? …

2
베이지안 로짓 모형-직관적 인 설명?
저의 학급, 학부 또는 대학원에서 그 용어에 대해 들어 보지 못했다고 고백해야합니다. 로지스틱 회귀 분석이 베이지안이라는 것은 무엇을 의미합니까? 다음과 비슷한 정규 물류에서 베이지안 물류로의 전환에 대한 설명을 찾고 있습니다. 이것은 선형 회귀 모델의 방정식입니다 : .E(y)=β0+β1x1+...+βnxnE(y)=β0+β1x1+...+βnxnE(y) = \beta_0 + \beta_1x_1 + ... + \beta_nx_n 이것은 로지스틱 회귀 모델 식이다 …

3
Brownian Bridge를 사용하여 Brownian 여행을 시뮬레이션 하시겠습니까?
Brownian 소풍 과정을 시뮬레이션하고 싶습니다 ( 에서 ~ 일 때 조절되는 Brownian 모션은 항상 양수입니다 ). Brownian 소풍 과정은 항상 긍정적 인 조건을 가진 Brownian 교량이므로 Brownian 교량을 사용하여 Brownian 소풍의 움직임을 시뮬레이션하기를 바랐습니다.0 t = 10<t<10<t<10 \lt t \lt 1000t=1t=1t=1 R에서는 브라운 브리지 프로세스를 시뮬레이션하기 위해 'h1017'패키지를 사용하고 있습니다. …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.