통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
기하 평균은 어떤 연속 분포의 평균에 대한 편견 추정량입니까?
닫힌 형태로 표현할 수있는 연속 분포가 있습니까? 그 평균은 표본의 기하 평균이 해당 평균에 대한 편향 추정치가되도록하는 것입니까? 업데이트 : 방금 샘플이 양수 (또는 기하 평균이 존재하지 않아야 함) 여야하므로 연속이 올바른 단어가 아닐 수도 있음을 깨달았습니다. 랜덤 변수의 음수 값에 대해 0이고 양수 값에 대해 연속적인 분포는 어떻습니까? 잘린 …

1
융기 부분과 올가미가 각각 잘 수행되지만 다른 계수를 생성 할 때 결과를 해석하는 방법
Lasso와 Ridge를 모두 사용하여 회귀 모델을 실행 중입니다 (0-5 범위의 이산 결과 변수 예측). 모델을 실행하기 전에 기능 세트를 250 에서 25 로 줄이는 SelectKBest방법을 사용 합니다. 초기 피처를 선택하지 않으면 Lasso와 Ridge는 정확도 점수가 낮아집니다 (샘플 크기가 작은 600 일 수 있음). 또한 일부 기능은 서로 관련되어 있습니다.scikit-learn 모델을 …


2
상자와 수염 그림을 읽는다 : 그룹들 사이에 큰 차이를 모을 수 있는가?
이 상자와 수염 그림을보고 있다고 가정 해보십시오. 목요일과 금요일 사이에, 나는 대부분의 시간이 잠들었다는 점에 동의한다고 생각합니다. 그래도 통계적으로 유효한 추측입니까? 내부 사 분위수 범위가 목요일과 금요일 사이에 겹치지 않기 때문에 중요한 차이를 식별 할 수 있습니까? 목요일과 금요일의 위스커와 위스커가 각각 겹치는 사실은 어떻습니까? 그것은 우리의 분석에 영향을 줍니까? …


6
베이지안 통계에 대한 MCMC의 기본 참조
Bayesian Statistics (With R)의 기본 MCMC에 대한 실용적이고 이론적 인 예가있는 논문이나 서적을 찾고 있습니다. 나는 시뮬레이션에 대해 연구 한 적이 없어서 "기본"정보를 찾고 있습니다. 몇 가지 권장 사항이나 조언을 줄 수 있습니까?

2
직교 적으로 할 수 없다면 생식으로하십시오 (다항식 회귀)
에 대해 대한 다항식 회귀 분석을 수행 할 때 때때로 사람들은 원시 다항식, 때로는 직교 다항식을 사용합니다. 그러나 그들이 완전히 임의적 인 것처럼 보이는 것을 사용할 때.X와이와이Y엑스엑스X 여기 에서 여기에 원시 다항식이 사용됩니다. 그러나 여기 와 여기 에서 직교 다항식은 올바른 결과를 제공하는 것으로 보입니다. 왜, 어떻게, 왜?! 반면에 교과서 …

2
불확실한 데이터로지도 학습?
불확실한 데이터 셋에지도 학습 모델을 적용하기위한 기존의 방법론이 있습니까? 예를 들어 클래스 A와 B가있는 데이터 세트가 있다고 가정 해 봅시다. +----------+----------+-------+-----------+ | FeatureA | FeatureB | Label | Certainty | +----------+----------+-------+-----------+ | 2 | 3 | A | 50% | | 3 | 1 | B | 80% | | …

2
축소가 영리한 방식으로 적용되는 경우 더 효율적인 추정기에서 항상 더 잘 작동합니까?
I 두 추정기 있다고 가정 과 같은 파라미터의 일관성 추정기 것을 그러한 저 와 의 PSD 감각. 따라서 은 보다 효율적 입니다. 이 두 추정기는 서로 다른 손실 함수를 기반으로합니다. β 2β0√βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0V1≤V2 β 1 β 2엔−−√( βˆ1− β0) →디엔( 0 , V1) ,엔−−√( βˆ2− β0) →디엔( 0 , V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) …

1
SVM의 일반화 범위
Support Vector Machines의 일반화 능력에 대한 이론적 결과에 관심이 있습니다. 예를 들어 분류 오류 확률 및 이러한 시스템의 Vapnik-Chervonenkis (VC) 치수 등이 있습니다. 그러나 문헌을 통해 읽은 결과, 유사한 반복 결과가 특히 주어진 범위를 유지하는 데 필요한 기술적 조건과 관련하여 저자마다 약간 씩 다른 경향이 있다는 인상을 받았습니다. 내가 SVM …

2
점점 더 많은 데이터가 수집 될수록 가능성 비율은 어떻게됩니까?
하자 , 와 밀도하고 당신이 가정 , . 로 가능성 비율 는 어떻게됩니까? (수렴? 무엇에?)fffggghhhxi∼hxi∼hx_i \sim hi∈Ni∈Ni \in \mathbb{N}∏i=1nf(xi)g(xi)∏i=1nf(xi)g(xi) \prod_{i=1}^n \frac{f(x_i)}{g(x_i)} n→∞n→∞n \rightarrow \infty 예를 들어 라고 가정 할 수 있습니다 . 일반적인 경우도 관심이 있습니다.h=gh=gh = g


1
푸 아송 분포의 데이터에 대한 로지스틱 회귀
일부 기계 학습 노트에서 일부 차별적 분류 방법, 특히 로지스틱 회귀 분석에 대해 이야기합니다. 여기서 y는 클래스 레이블 (0 또는 1)이고 x는 데이터입니다. 만약 및 X는 | y는 1 \ SIM \ mathrm {} 포아송 (λ_1) = 다음 P (Y | X)를 물류 것이다.x|y=0∼Poisson(λ0)x|y=0∼Poisson(λ0)x|y = 0 \sim \mathrm{Poisson}(λ_0)x|y=1∼Poisson(λ1)x|y=1∼Poisson(λ1)x|y = 1 …

3
베이지안 모수 추정 또는 베이지안 가설 검정?
베이지안 커뮤니티 내에서 베이지안 모수 추정을 수행해야하는지 아니면 베이지안 가설 검정을 수행해야하는지에 대한 논의가 진행중인 것 같습니다. 나는 이것에 대한 의견을 구하는 데 관심이 있습니다. 이러한 접근 방식의 상대적 강점과 약점은 무엇입니까? 어떤 상황에서 다른 것보다 더 적절한가? 모수 추정과 가설 검정을 모두 수행해야합니까, 아니면 하나만 수행해야합니까?

2
가장 밀접하게 연관된 예측 변수가 이진일 때 회귀 모델 구축을 시작하는 방법
I, 즉 세 개의 변수 (365)의 관찰을 포함하는 데이터 세트를 pm, temp그리고 rain. 이제 pm다른 두 변수의 변경에 대한 응답 으로 동작을 확인하고 싶습니다 . 내 변수는 다음과 같습니다 pm10 = 응답 (종속) temp = 예측 자 (독립) rain = 예측 자 (독립적) 다음은 내 데이터의 상관 관계 매트릭스입니다. > …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.