통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
이론, 적합 또는 다른 것에 기초하여 분포를 선택하는 것이 더 낫습니까?
이것은 철학적 질문에 접해 있지만 더 많은 경험을 가진 다른 사람들이 분포 선택에 대해 어떻게 생각하는지에 관심이 있습니다. 어떤 경우에는 이론이 가장 잘 작동 할 수 있음이 분명해 보입니다 (마우스 꼬리 길이는 아마도 정규 분포 일 것입니다). 많은 경우에 데이터 세트를 설명하는 이론이 없을 수도 있으므로 원래 설명하기 위해 개발 …

1
분류를 위해 HMM을 교육하려면 어떻게해야합니까?
따라서 분류를 위해 HMM을 훈련시킬 때 표준 접근법은 다음과 같습니다. 데이터 세트를 각 클래스의 데이터 세트로 분리하십시오. 수업 당 하나의 HMM 훈련 테스트 세트에서 각 모델의 가능성을 비교하여 각 창을 분류하십시오. 그러나 각 수업에서 HMM을 어떻게 훈련합니까? 한 클래스와 관련된 데이터를 함께 연결합니까? 그러나 시계열 데이터는 순차적이 아닙니다. 그렇게하면 일부 …

3
상자 그림에서 분산 추론
상자 그림을 사용하여 변수의 분산을 추론하는 방법이 궁금합니다. 두 개의 변수가 상자 그림을 관찰하여 동일한 분산을 갖는지 추론 할 수 있습니까?
12 variance  boxplot 

1
검정 통계량 분포가 양봉형이면 p- 값이 의미가 있습니까?
P- 값은 귀무 가설이 참이라고 가정 할 때 관찰 된 것 이상으로 검정 통계량을 얻을 확률을 정의합니다. 다시 말해, 그러나 검정 통계량이 분포에서 양봉이면 어떻게됩니까? p- 값이이 맥락에서 어떤 의미입니까? 예를 들어, R에서 일부 바이 모달 데이터를 시뮬레이션하려고합니다.P(X≥t|H0)P(X≥t|H0)P( X \ge t | H_0 ) set.seed(0) # Generate bi-modal distribution bimodal …


1
비 수학자를위한 Clopper-Pearson
누군가 Clopper-Pearson CI 이외의 직관에 대한 비율을 설명 할 수 있는지 궁금합니다. 내가 아는 한 모든 CI에는 차이가 있습니다. 그러나 비율의 경우 비율이 0 또는 1 (0 % 또는 100 %) 인 경우에도 Clopper-Pearson CI를 계산할 수 있습니다. 수식을 보려고 시도했는데 이항 분포의 백분위 수를 갖는 것으로 이해하고 CI를 찾는 …

4
불확실성을 포함한 커널 밀도 추정
1 차원 데이터를 시각화 할 때 커널 밀도 추정 기법을 사용하여 잘못 선택된 빈 너비를 설명하는 것이 일반적입니다. 1 차원 데이터 셋에 측정 불확실성이있는 경우이 정보를 통합하는 표준 방법이 있습니까? 예를 들어 (내 이해가 순진한 경우 용서) KDE는 관측치의 델타 함수로 가우시안 프로파일을 구성합니다. 이 Gaussian 커널은 각 위치간에 공유되지만 …

2
설문지에서 쓸모없는 질문 식별
설문지를 개발 중입니다. 신뢰성과 유효성을 향상시키기 위해 통계적 방법을 사용하고 싶습니다. 답이 항상 같은 질문을 제거하고 싶습니다. 이는 거의 모든 참가자가 해당 질문에 대해 동일한 답변을 하였음을 의미합니다. 이제 내 질문은 : 사용 맥락과 무관하게 답이 항상 같은 쓸모없는 질문에 대한 기술적 용어는 무엇입니까? 그러한 질문을 식별하는 방법은 무엇입니까?

1
ZINB 또는 다른 효과가 혼합 된 카운트 데이터에 적합한 모델을 찾는 데 어려움이 있습니까?
나는 고독한 꿀벌 풍부도에 대해 매우 작은 데이터 세트를 가지고 있는데, 분석하는데 문제가 있습니다. 그것은 계수 데이터이며, 거의 모든 계수는 다른 처리에서 대부분의 0으로 처리됩니다. 6 개의 사이트 중 2 개에 각각 하나씩 두 개의 매우 높은 값이 있으므로 카운트 분포가 매우 긴 꼬리를 갖습니다. R에서 일하고 있습니다. lme4와 glmmADMB의 …

4
교차 유효성 검사를 통해 근거가없는 데이터 집합에서 서로 다른 클러스터링 방법을 비교할 수 있습니까?
현재, 나는 진실이없는 텍스트 문서 데이터 세트를 분석하려고합니다. k-fold cross validation을 사용하여 다른 클러스터링 방법을 비교할 수 있다고 들었습니다. 그러나 과거에 보았던 예는 근거가 있습니다. 이 데이터 세트에서 k-fold 방법을 사용하여 결과를 확인할 수있는 방법이 있습니까?

1
베리 역전
미국의 와인 판매에 대한 대규모 집계 시장 데이터가 있으며 특정 고품질 와인에 대한 수요를 추정하고 싶습니다. 이러한 시장 점유율은 기본적으로 형태의 임의의 유틸리티 모델에서 파생 된이 여기서 X 관찰 포함 제품 특성, p는 제품 가격을 나타내고, ξUijt=X′jtβ−αpjt+ξjt+ϵijt≡δjt+ϵjtUijt=Xjt′β−αpjt+ξjt+ϵijt≡δjt+ϵjtU_{ijt} = X’_{jt}\beta - \alpha p_{jt} + \xi_{jt} + \epsilon_{ijt} \equiv \delta_{jt} + \epsilon_{jt}XXXpppξξ\xi영향을 …

2
대중을위한 피자 통계
NY Times 웹 사이트의 짧은 항목 은 미국의 피자 소비 사실과 수치 를 제공합니다 . 통계를 사용하여 일반 청중에게 정보를 제공하는 방법에 관심이 있으며 제시된 통계를 기반으로 몇 가지 질문이 있습니다. 오늘날 미국인 8 명 중 1 명이 피자를 먹는다면, 평균 미국인이 8 일에 한 번씩 피자를 먹을 것입니까? 여기에 …

1
일반화 된 비선형 최소 제곱 회귀에 대한 "손으로"로그 가능성 계산 (nlme)
함수 에 대한 일반화 된 비선형 최소 제곱 회귀에 대한 로그 우도를 계산하려고 합니다. ( 패키지 로부터) 브라운 운동을 가정하여 계통 발생 수 트리에서 거리에 의해 생성 된 분산 공분산 행렬을 사용하여 R 패키지의 함수 . 다음의 재현 가능한 R 코드는 x, y 데이터와 9 개의 분류법을 가진 임의의 트리를 …

3
Leptokurtic 분포를 정규로 변환하는 방법은 무엇입니까?
정규성으로 변환하고 싶은 leptokurtic 변수가 있다고 가정합니다. 이 작업을 수행 할 수있는 변형은 무엇입니까? 데이터 변환이 항상 바람직하지는 않지만 학업을 추구함에 따라 데이터를 정상으로 "해머링"한다고 가정합니다. 또한 그림에서 알 수 있듯이 모든 값은 엄격하게 양수입니다. 나는 포함하여 내가 전에 사용 보았다 변환의 다양한 (거의 아무것도 시도 등)이지만 특히 잘 작동하지는 …

5
분포의 첨도는 밀도 함수의 기하학과 어떤 관련이 있습니까?
첨도는 분포의 정점과 평탄도를 측정하는 것입니다. 분포의 밀도 함수 (있는 경우)는 곡선으로 볼 수 있으며 모양과 관련된 기하학적 특성 (예 : 곡률, 볼록도 등)이 있습니다. 분포의 첨도가 첨도의 기하학적 의미를 설명 할 수있는 밀도 함수의 일부 기하학적 특징과 관련이 있는지 궁금합니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.