통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
시계열의 통계적 유사성
주기, 최대, 최소, 평균 등과 같은 다양한 측정을 수행 할 수있는 시계열이 있다고 가정하고이를 사용하여 동일한 속성을 가진 모델 사인파를 생성한다고 가정 할 수 있습니다. 실제 데이터가 가정 된 모델과 얼마나 밀접하게 일치합니까? 시리즈의 데이터 포인트 수는 10 ~ 50 포인트입니다. 매우 간단한 첫 번째 생각은 사인파의 방향성 움직임에 값을 …

4
동일한 자유 도로 혼합 효과 모델 비교
여기서 추상화하려고하는 실험이 있습니다. 내가 당신 앞에 하얀 돌 3 개를 던지고 그들의 위치에 대한 판단을 요구한다고 상상해보십시오. 나는 돌의 다양한 속성과 당신의 응답을 기록합니다. 나는 여러 과목에 걸쳐 이것을한다. 두 가지 모델을 생성합니다. 하나는 가장 가까운 돌이 응답을 예측하고 다른 하나는 돌의 기하학적 중심이 응답을 예측한다는 것입니다. 따라서 RI에서 …

3
일부는 Google 문서 스프레드 시트를 사용하여 통계 작업을 수행하고 다른 사람과 공유합니까?
대부분의 사용자는 Google 문서 도구가 여전히 기본 도구라고 생각합니다. Matlab 또는 R이 아니며 Excel조차도 아닙니다. 그러나 브라우저의 작동 기능 만 사용하는 (그리고 매우 다르게 작동하는 많은 브라우저와 호환되는)이 웹 기반 소프트웨어의 힘에 당황합니다. 이 포럼에서 활동중인 Mike Lawrence는 Google 문서 도구를 사용하여 아주 멋진 작업을 수행하면서 스프레드 시트를 공유했습니다. 필자는 …


5
많은 데이터를 그래픽으로 표시하는 좋은 방법
주택 데이터에 대한 14 개의 변수와 345,000 개의 관찰 (연도, 평방 피트, 판매 가격, 거주지 등)을 포함하는 프로젝트를 진행하고 있습니다. 좋은 그래픽 기술과 멋진 플로팅 기술을 포함하는 R 라이브러리를 찾으려고 노력하고 있습니다. 나는 ggplot과 격자에서 무엇이 잘 작동하는지 이미보고 있으며, 숫자 변수에 대한 바이올린 플롯을 생각하고 있습니다. 사람들이 명확하고 세련되며 …

4
메타 분석의 좋은 입문 치료를 찾고
(비 통계 학자) 동료가 의학 저널에 대한 논문 검토에서 메타 분석을 경험하고 있으며 자신을 교육 할 수있는 우수한 입문 수준의 치료를 찾고 있습니다. 어떤 추천? 즐겨 찾기? 책, 논문, 비 기술적 조사 기사 모두 괜찮을 것입니다. (예, 그는 Wikipedia 항목 및 Jerry Dallal의 멋진 작은 기사 와 같은 Google 검색으로 …

10
데이터 마이닝 소프트웨어 도구에 대한 조사
엔지니어로 훈련을 받았지만 데이터 마이닝에 더 관심이있는 것으로 나타났습니다. 지금은 현장을 더 조사하려고합니다. 특히, 나는 존재하는 다양한 소프트웨어 툴 범주와 각 카테고리에서 주목할만한 툴과 그 이유를 이해하고 싶습니다. (저는 "최고의"도구는 말하지 않았으며, 주목할만한 도구는 화염 전쟁을 시작하지 않을 것입니다.) 특히 오픈 소스 도구이고 자유롭게 사용할 수있는 도구를 기록해 두십시오. 나는 …

9
컴퓨터 과학에 적용되는 전산 통계에 대한 개요를 제공하는 책은 무엇입니까?
저는 소프트웨어 엔지니어로서 통계 알고리즘, 데이터 마이닝, 기계 학습, 베이지안 네트워크, 분류 알고리즘, 신경망, Markov 체인, Monte Carlo 방법 및 난수 생성과 같은 주제에 관심이 있습니다. 개인적으로 이러한 기술을 직접 사용하는 것은 즐겁지 않았지만, 그 기술을 사용하고 그에 대해 더 많이 알고 싶어하는 소프트웨어를 높은 수준에서 사용해야했습니다. 큰 폭의 책을 …

5
작은 샘플 임상 연구에서 머신 러닝 기술 적용
분류 맥락에서 흥미로운 예측 변수를 분리하는 것이 목표 인 경우 소규모 표본 임상 연구에서 랜덤 포레스트 또는 벌점 형 회귀 (L1 또는 L2 페널티 또는 이들의 조합으로)와 같은 기계 학습 기술을 적용하는 것에 대해 어떻게 생각하십니까? 모델 선택에 대한 질문이 아니며 가변 효과 / 중요도에 대한 최적의 추정치를 찾는 방법에 …

5
제임스-스타 인의 축소는 '야생'?
나는 James-Stein 수축에 대한 아이디어를 얻었습니다 (즉, 독립적 인 법선으로 구성된 벡터에 대한 단일 관찰의 비선형 함수는 랜덤 변수의 수단을 더 잘 추정 할 수 있습니다. 여기서 '더 나은'은 제곱 오차로 측정됩니다) ). 그러나 응용 작업에서 본 적이 없습니다. 분명히 나는 ​​충분히 읽지 못했습니다. James-Stein이 적용된 환경에서 추정을 개선 한 …


3
대규모 모집단을 폴링 할 때 표본 크기를 어떻게 결정합니까?
호주는 현재 선거를 진행하고 있으며 언론은 매일 새로운 정치 여론 조사 결과를보고합니다. 통계적으로 유효한 결과를 얻으려면 2,200 만 명의 국가에서 인구의 몇 퍼센트를 샘플링해야합니까? 너무 큰 샘플을 사용하면 결과에 영향을 줄 수 있습니까, 아니면 샘플 크기에 따라 통계적 유효성이 단조 증가합니까?


10
어플리케이션에 가장 적합한 2 등급 분류기는 무엇입니까? [닫은]
폐쇄되었습니다 . 이 질문은 의견 기반 입니다. 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 이 게시물 을 편집 하여 사실과 인용으로 답변 할 수 있도록 질문을 업데이트하십시오 . 휴일 삼년 전에 . 규칙 : 답변 당 하나의 분류 자 동의하면 투표 중복을 제거 / 제거합니다. 의견에 당신의 응용 프로그램을 넣어

8
"핸들 바"플롯에 대한 대체 그래픽
연구 분야에서 데이터를 표시하는 일반적인 방법은 막 대형 차트와 "핸들 막대"를 조합하여 사용하는 것입니다. 예를 들어 "핸들 바"는 작성자에 따라 표준 오류와 표준 편차를 번갈아 표시합니다. 일반적으로 각 "bar"의 샘플 크기는 약 6입니다. 이 음모는 생물 과학에서 특히 인기가있는 것으로 보입니다 . 예를 들어 BMC Biology 의 처음 몇 권을 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.