통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
McNemar의 검정에서 정규 분포가 아닌 카이 제곱을 사용하는 이유는 무엇입니까?
나는 정확하지 않은 McNemar의 테스트가 카이 제곱 점근 분포를 어떻게 사용하는지 알아 냈습니다. 그러나 (두 경우 표에 대한) 정확한 검정은 이항 분포에 의존하기 때문에 이항 분포에 대한 정규 근사를 제안하는 것이 일반적이지 않은 이유는 무엇입니까? 감사.

4
게시 된 리 커트 규모의 항목 수를 유효하게 줄일 수 있습니까?
[피드백-에 대한 답변으로 수정 된 내용 :-)] 도! 더 많은 편집! 죄송합니다! 안녕하세요- 사기 및 기타 문제에 관한 출판 규모를 사용하여 의료진에게 보낸 설문 조사를 통해 다소 거칠고 준비된 데이터 수집을 수행하고 있습니다. 유일한 것은 조사에서 다른 모든 것들과 함께 규모가 다소 길다는 것입니다. 각 하위 규모를 반으로 줄이고 항목의 …

3
다차원 시계열을 이용한 개입 분석
시간이 지남에 따라 주류 판매에 대한 정책 결정 결과를 수량화하기 위해 개입 분석을 수행하고 싶습니다. 그러나 시계열 분석에 익숙하지 않으므로 초보자 질문이 있습니다. 문헌을 조사한 결과 다른 연구자들은 ARIMA를 사용하여 알코올의 시계열 판매량을 모형화했으며, 회귀 변수로 더미 변수를 사용하여 중재 효과를 모델링 한 것으로 나타났습니다. 이것이 합리적인 접근 방법 인 …


6
20,000 회의 토스에서 10,000 개의 헤드가 유효하지 않은 데이터를 제안하는 이유에 대한 통계적 주장
공정한 동전을 반복해서 던지고 머리와 꼬리의 수가 거의 같아야한다고 가정 해 봅시다. 10 번의 머리와 10 번의 꼬리와 같은 결과가 총 20 회 던질 때, 우리는 그 결과를 믿고 동전이 공정하다고 믿는 경향이 있습니다. 글쎄, 당신이 총 20000 토스에 대해 10000 헤드와 10000 테일과 같은 결과를 볼 때, 나는 이것이 …


2
누군가가 이미지를 좋아할 확률
나는 다음과 같은 문제가 있습니다 : -우리는 N 명 세트-우리는 K 이미지 세트가 있습니다 -각 사람은 몇 장의 이미지를 평가합니다. 사람은 이미지를 좋아하거나 좋아하지 않을 수 있습니다 (이 둘은 유일한 가능성입니다). -문제는 어떤 사람이 특정 이미지를 좋아할 가능성을 계산하는 방법입니다. 직관을 제시하는 예를 들어 보겠습니다. N = 4 K = …

3
평균 GPS 포인트 찾기
포인트 집단에서 평균 GPS 포인트를 찾기위한 프로그램을 작성해야합니다. 실제로 다음이 발생합니다. 매달 사람은 동일한 정적 자산의 GPS 포인트를 기록합니다. GPS의 특성상이 점들은 매달 약간 씩 다릅니다. 때로는 사람이 완전히 다른 위치에서 잘못된 주장을 잘못 기록하는 경우가 있습니다. 각 GPS 포인트에는 현재 GPS 데이터의 정확도를 나타내는 확실성 가중치 ( HDOP )가 …
11 outliers  spatial 

3
근사
무엇에 근접하는 가장 좋은 방법 주어진 두 개의 정수가 당신은 평균 알고 , 분산 , 비대칭 과 초과 첨도 이산 분포의 그리고 및 형태의 (0이 아닌) 측정 값 에서 정상적인 근사값이 적절하지 않다는 것이 합니까?m , n μ σ 2 γ 1 γ 2 X γ 1 γ 2피r [ …

6
배낭 제한 조건이있는 통계 라이브러리
아주 작은 통계 도서 라이브러리를 구축하기 위해 200 달러의 미국이 있다고 가정 해 봅시다. 당신의 선택은 무엇입니까? 아마존에서 무료로 배송 할 수 있으며 인터넷에서 무료로 제공되는 모든 텍스트는 공정한 게임이지만 페이지 당 5 센트의 비용이 청구됩니다. (Dover 서적의 메일에서 영감을 받았지만 대부분의 제품은 약간 오래된 것 같습니다.)

3
전문가 세트를 주문하거나 순위를 매기는 방법은 무엇입니까?
필드에 많은 전문가가 포함 된 데이터베이스가 있습니다. 각 전문가마다 다음과 같은 다양한 속성 / 데이터 포인트가 있습니다. 수년간의 경험. 라이센스 리뷰 수 그 리뷰의 텍스트 내용 속도, 품질 등과 같은 여러 가지 요소에 대한 각 리뷰의 5 성급 평가 상, 협회, 회의 등 이 전문가들의 중요성을 기준으로 10 명 중 …
11 rating  valuation 

6
확률 도입에 대해 가장 좋아하는 문제는 무엇입니까?
저는 Boy 또는 Girl 또는 Bertrand 역설 을 논의하여 확률을 소개하는 것을 좋아 합니다. 어떤 다른 (짧은) 문제 / 게임이 확률에 동기 부여를 제공합니까? ( 응답 당 하나의 답변을 부탁드립니다. ) 추신 : 이것은 확률에 대한 완만 한 소개에 관한 것이지만, 제 생각으로는 불연속 사건, 베이 즈 정리, 확률 적 …
11 teaching 

3
상충되는 결과를 얻을 때 어떤 것이 더 나은 연구인지를 어떻게 감지합니까?
당신은 종종 반대 방향의 결과를 결론 짓는 다양한 연구를 언론에서 접하게됩니다. 이것들은 새로운 처방약의 테스트 또는 특정 영양소 또는 그 문제에 대한 다른 장점과 관련이 있습니다. 그러한 두 가지 연구가 상충되는 결과에 도달하면 두 가지 중 어느 것이 진실에 가장 가까운 지 어떻게 알 수 있습니까?

4
임상 시험에 대한 좋은 텍스트?
저는 임상 시험 분석의 훌륭한 치료법을 찾고있는 학부 통계 학생입니다. 텍스트는 실험 주제, 차단, 전력 분석, 라틴 사각형 설계 및 군집 무작위 설계의 기본 사항을 다루어야합니다. 수학 통계와 실제 분석에 대한 학부 지식이 있지만 약간 더 높은 수준의 통계 또는 분석이 필요한 환상적인 텍스트가 있으면 그에 맞게 작업 할 수 …

1
R의 princomp () 객체에 대한 summary ()와 loading ()의 차이점은 무엇입니까?
예제 코드 : (pc.cr <- princomp(USArrests)) summary(pc.cr) loadings(pc.cr) ## note that blank entries are small but not zero 각기 다른 출력을 얻었고 차이점이 무엇인지 잘 모르겠습니다. 출력은 다음과 같습니다. > summary(pc.cr) Importance of components: Comp.1 Comp.2 Comp.3 Comp.4 Standard deviation 82.8908472 14.06956001 6.424204055 2.4578367034 Proportion of Variance 0.9655342 0.02781734 0.005799535 …
11 r  pca 

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.