통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
기계 학습을위한 시계열의 순서
교차 검증 및 시계열에 대한 RJ Hyndman 의 "연구 팁"중 하나를 읽은 후 여기에서 공식화하려고하는 오래된 질문으로 돌아 왔습니다. 분류 또는 회귀 문제에서 데이터의 순서는 중요하지 않으므로 k 배 교차 검증을 사용할 수 있습니다. 반면 시계열에서 데이터 순서는 매우 중요합니다. 그러나 기계 학습 모델을 사용하여 시계열을 예측할 때 일반적인 전략은 …

2
표준 편차에 대한 삼각법 연산
정규 확률 변수의 더하기, 빼기, 곱하기 및 나누기가 잘 정의되어 있지만 삼각법 연산은 어떻습니까? 예를 들어, 치수가 d1d1d_1 과 d2d2d_2 인 두 카테 티를 가진 삼각형 쐐기 (직각 삼각형으로 모델링 됨)의 각도를 찾으려고한다고 가정합시다 . 직감과 시뮬레이션 모두 결과 분포가 평균이며 평균 arctan(mean(d1)mean(d2))arctan⁡(mean(d1)mean(d2))\arctan\left(\frac{\text{mean}(d_1)}{\text{mean}(d_2)}\right). 그러나 결과 각도의 분포를 계산하는 방법이 있습니까? …

1
R에서 음모와 같은 연령 피라미드를 만드는 방법은 무엇입니까?
잠김 . 이 질문과 주제는 주제가 다르지만 역사적으로 중요하기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. Age Pyramid는 다음과 같습니다. 비슷한 범주를 가진 2 개의 막대 그래프 (히스토그램이 아님)를 세로로 회전하고 피라미드에서와 같이 양쪽으로 확장하고 싶습니다. R에서 이것을 수행하는 간단한 방법입니까? 각 막대의 색상을 제어하는 ​​것도 …

3
회귀 모형이 과적 합한 시점을 탐지하는 방법은 무엇입니까?
작업을 수행하는 사람 일 때 수행중인 작업을 알고 있으면 모델에 과적 합한 시점에 대한 감각이 생깁니다. 우선, 모델의 조정 된 R 제곱에서 추세 또는 악화를 추적 할 수 있습니다. 주요 변수의 회귀 계수 p 값에서 유사한 저하를 추적 할 수도 있습니다. 그러나 다른 사람의 연구를 읽고 자신의 내부 모델 개발 …

2
GPS 경로로 오류 관리 (이론적 프레임 워크?)
나는 특히 경로를 다룰 때 GPS 시스템의 오류를 처리하는 방법을 이해하는 데 도움이되는 적절한 이론적 프레임 워크 또는 전문 분야를 찾고 있습니다. 기본적으로, 트레일 길이를 설정하는 데 사용할 데이터 및 알고리즘에 대한 요구 사항을 찾고 있습니다. 대답은 신뢰할 수 있어야합니다. 내 친구는 160km로 청구 된 경주의 경주 책임자 였지만 Garmin은 …
14 error  sampling 



2
선택한 기능 수가 줄어들면 랜덤 포리스트 OOB 오류 추정치가 개선되는 이유는 무엇입니까?
1000 개의 기능을 가진 두 개의 알려진 그룹으로 분할 된 마이크로 어레이 데이터 세트에서 분류 자로 임의 포리스트 알고리즘을 적용하고 있습니다. 처음 실행 한 후에는 기능의 중요성을 살펴보고 5, 10 및 20 개의 가장 중요한 기능으로 트리 알고리즘을 다시 실행합니다. 모든 기능의 상위 10 및 20에서 오류율의 OOB 추정치는 1.19 …

3
고정 효과 로지스틱 회귀 분석을위한 R 패키지
RChamberlain의 1980 추정기를 사용하여 개별 고정 효과 (개별 차단)로 로짓 모델의 계수를 추정 하기위한 패키지를 찾고 있습니다. 종종 Chamberlain의 고정 효과 로짓 추정기로 알려져 있습니다. 이진 결과 패널 데이터 (적어도 계량 경제학)를 다룰 때 고전적인 견적 도구이지만 CRAN에서 관련 데이터를 찾지 못했습니다. 실마리?

3
적절한 분석 기술 및 테스트를 선택하는 데 도움이되는 순서도
통계 지식이 필요하지만 공식적으로 훈련 된 통계학자는 아니지만 특정 문제를 해결하기위한 올바른 접근 방식을 선택하는 데 도움이되는 순서도 (또는 일종의 의사 결정 트리)를 갖는 것이 도움이됩니다. 기술이 필요합니다. 기술 X를 사용하십시오. 데이터가 정상이 아닌 경우 Y 또는 Z를 사용하십시오 "). 인터넷 검색 후 다양한 커버리지와 품질에 대한 몇 가지 시도를 …

2
혼합 효과 모델에서 예측 된 값에 대한 신뢰 구간은 무엇을 의미합니까?
이 페이지를 보고있었습니다R에서 lme와 lmer의 신뢰 구간에 대한 방법을 발견했습니다. R을 모르는 사람들은 혼합 효과 또는 다단계 모델을 생성하는 함수입니다. 반복 측정 설계와 같은 효과를 수정 한 경우 예측 된 값 (평균과 유사) 주변의 신뢰 구간은 무엇을 의미합니까? 효과에 대해 합리적인 신뢰 구간을 가질 수는 있지만 그러한 설계에서 예측 평균 …

4
후속 조치 : ANOVA 사이의 혼합 된 플롯에서 추정 된 SE 또는 실제 SE?
나는 현재 논문을 완성하고 있으며 어제 부터이 질문에 우연히 빠져 나에게 같은 질문을 던졌다. 데이터 또는 실제 분산 분석에서 추정 된 실제 오차를 그래프에 제공하는 것이 더 낫습니까? 어제의 질문은 다소 구체적이지 않았고 내 것이 매우 구체적이기 때문에이 후속 질문을 제기하는 것이 적절하다고 생각했습니다. 세부 사항 : 나는 두 그룹 …

12
통계 회의?
가장 중요한 연례 통계 회의는 무엇입니까? 규칙 : 답변 당 하나의 회의 회의에 대한 링크 포함

9
클러스터링을위한 시각화 소프트웨어
잠김 . 이 질문과 주제는 주제가 다르지만 역사적으로 중요하기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. ~ 22000 포인트를 클러스터하고 싶습니다. 많은 클러스터링 알고리즘은 고품질 초기 추측으로 더 잘 작동합니다. 거친 데이터 형태에 대한 좋은 아이디어를 제공 할 수있는 도구는 무엇입니까? 나는 자신의 거리 측정법을 선택할 …

4
KL 분기에 대한 질문?
두 분포를 KL 분기와 비교하여이 측정에 대해 읽은 내용에 따라 하나의 가설을 다른 가설로 변환하는 데 필요한 정보의 양인 비표준 숫자를 반환합니다. 두 가지 질문이 있습니다. a) 효과 크기 나 R ^ 2와 같이보다 의미있는 해석을 갖도록 KL 분기를 정량화하는 방법이 있습니까? 어떤 형태의 표준화? b) R에서 KLdiv (flexmix 패키지)를 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.