통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
순차적 Monte Carlo 필터의 Rao-Blackwellization
논문 A. Doucet 등의 "동적 베이지안 네트워크를위한 라오-블랙웰 화 된 입자 필터링" . 알. 마르코프 프로세스 에서 선형 하부 구조 를 이용하는 순차 몬테 카를로 필터 (입자 필터)가 제안된다 . 이 선형 구조의 주 변화에 의해, 필터는 입자 필터를 사용하는 비선형 부분과 칼만 필터에 의해 처리 될 수있는 하나의 선형 …

2
분류 문제에서 클래스 분리 성 측정
선형 판별 학습자에서 클래스 분리 성을 측정하는 좋은 예는 Fisher의 선형 판별 비율입니다. 기능 세트가 대상 변수 사이에 클래스를 잘 분리 할 수 ​​있는지 판별하기위한 다른 유용한 지표가 있습니까? 특히, 대상 클래스 분리를 ​​최대화하기위한 우수한 다변량 입력 속성을 찾는 데 관심이 있으며, 비선형 / 비모수 적 측정을 통해 분리 성이 …

3
로지스틱 회귀 분석에서 변수의 중요성
아마도 백 번 전에 해결 된 문제를 다루고 있지만 대답을 어디서 찾을 수 있는지 잘 모르겠습니다. 로지스틱 회귀 분석을 사용할 때 많은 기능 을 고려하고 이진 범주 값 를 예측하려고하면 잘 예측하는 기능의 하위 집합을 선택하는 데 관심이 있습니다. y y엑스1, . . . , x엔x1,...,xnx_1,...,x_n와이yy와이yy 올가미와 유사한 절차를 사용할 …

2
유전자 복제 수준에 따른 농축 분석
생물학적 배경 시간이 지남에 따라 일부 식물 종은 전체 게놈을 복제하여 각 유전자의 추가 사본을 얻는 경향이 있습니다. 이러한 구성의 불안정성으로 인해, 이들 유전자 중 다수가 결실되고 게놈이 재 배열되고 안정화되어 다시 복제 될 준비가된다. 이러한 복제 이벤트는 종 분화 및 침입 이벤트와 관련이 있으며, 이론에 따르면 복제는 식물이 새로운 …


2
R randomForest에서 교체를 통한 샘플링
randomForest 구현은 대체로 샘플링 할 때도 관측치 수를 넘어서 샘플링을 허용하지 않습니다. 왜 이런거야? 잘 작동합니다. rf <- randomForest(Species ~ ., iris, sampsize=c(1, 1, 1), replace=TRUE) rf <- randomForest(Species ~ ., iris, sampsize=3, replace=TRUE) 내가하고 싶은 것 : rf <- randomForest(Species ~ ., iris, sampsize=c(51, 1, 1), replace=TRUE) Error in …

1
각 유권자의 정확성과 관련 불확실성을 사용하는 투표 시스템
우리가 답을 알고 싶은 간단한 "예 / 아니오"질문이 있다고합시다. 그리고 정답에 "투표"하는 N 명의 사람들이 있습니다. 모든 유권자는 1과 0의 목록을 가지고 있으며 과거에 이런 종류의 질문에 대해 옳았는지 아닌지를 보여줍니다. 역사를 이항 분포로 가정하면 그러한 질문, 변동, CI 및 기타 모든 종류의 신뢰도 지표에서 유권자의 평균 성과를 찾을 수 …

1
역동적 인 베이지안 시스템의 정의와 HMM과의 관계?
에서 위키 백과 DBN (Dynamic Bayesian Network)은 인접한 시간 간격에 따라 변수를 서로 관련시키는 베이지안 네트워크입니다. T 시점에서 변수 값을 내부 회귀 변수와 직전의 이전 값 (시간 T-1)에서 계산할 수 있기 때문에이를 종종 2 타임 슬라이스 BN이라고합니다 . DBN은 로봇 공학에서 일반적이며 광범위한 데이터 마이닝 응용 프로그램에 대한 잠재력을 보여주었습니다. …

1
연속 예측 변수와 범주 예측 변수 간의 상호 작용에 대한 혼합 모형 다중 비교
lme4혼합 효과 회귀에 적합 multcomp하고 쌍별 비교를 계산하는 데 사용 하고 싶습니다 . 여러 개의 연속적이고 범주 형 예측 변수가있는 복잡한 데이터 세트가 있지만 내장 ChickWeight데이터 세트를 예로 사용하여 질문을 시연 할 수 있습니다 . m <- lmer(weight ~ Time * Diet + (1 | Chick), data=ChickWeight, REML=F) Time연속적이고 Diet범주 …

2
R의 무 팽창 카운트 모델 : 실제 장점은 무엇입니까?
비 팽창 조류 수를 분석하기 위해 R 패키지 pscl을 사용하여 무 팽창 수 모델을 적용하고 싶습니다 . 그러나 주요 기능 중 하나 ( ? zeroinfl ) 에 대한 설명서에 제공된 예제를 살펴보면 이러한 모델의 실제 이점이 무엇인지 의심하기 시작합니다. 주어진 샘플 코드에 따르면, 표준 포아송, 준-포아송 및 음수 이코노미 얼 …

1
디리클레 후부
Dirichlet 사후 분포에 대한 질문이 있습니다. 다항식 우도 함수를 고려할 때, 는 이며 는 관측치 의 횟수 입니다.Dir(αi+Ni)Dir(αi+Ni)Dir({\alpha_i + N_i})NiNiN_iithithi^{th} 주어진 고정 데이터 대해 를 줄이기 시작하면 어떻게됩니까 ? 후자의 형태로부터, 어느 시점 이후에 s는 후부에 영향을 미치지 않을 것으로 보인다 . 그러나 우리가 매우 작게 만들 때 확률 질량이 …

3
요인 분석의 가정은 무엇입니까?
FA ( 전통적, 선형) 요인 분석 (FA), 특히 FA 이전 (및 가능하게는 이후에) 가정 을 실제로 이해했는지 확인하고 싶습니다 . 일부 데이터는 초기에 상관 관계가 있어야하며 데이터간에 선형 관계가있을 수 있습니다. 요인 분석을 수행 한 후에는 데이터가 정규 분포 (각 쌍에 대한 이변 량 분포)로 분포되며 요인 (공통 및 특정) …


3
변동 계수에 대한 직감 및 용도
현재 Coursera.org의 운영 관리 소개 과정에 참석하고 있습니다. 코스의 어느 시점에서 교수는 운영 시간의 변화를 다루기 시작했습니다. 그가 사용하는 측정 값 은 표준 편차와 평균의 비율 인 변동 계수입니다 . 씨V= σμ씨V=σμc_v = \frac{\sigma}{\mu} 이 측정이 왜 사용됩니까? 표준 편차를 사용하는 것 외에 CV를 사용할 경우의 장단점은 무엇입니까 ? 이 …

2
내가 얻은이 이산 분포 (재귀 차이 방정식)의 이름은 무엇입니까?
나는 컴퓨터 게임에서이 배포판을보고 그 동작에 대해 더 배우고 싶었다. 주어진 수의 플레이어 동작 후에 특정 이벤트가 발생해야하는지에 대한 결정에서 비롯됩니다. 이 이상의 세부 사항은 관련이 없습니다. 다른 상황에도 적용되는 것 같고 계산하기 쉽고 긴 꼬리를 만들기 때문에 흥미로 웠습니다. 모든 단계 에서, 게임은 균일 한 난수 합니다. 경우 , …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.