통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
이항 GLMM (glmer)을 비율 또는 분수 인 반응 변수에 맞추기
나는 누군가가 내가 비교적 간단한 질문이라고 생각하는 것을 도울 수 있기를 바라고 있으며, 나는 대답을 알고 있다고 생각하지만 확인 없이는 내가 확신 할 수없는 것이되었습니다. 카운트 변수를 반응 변수로 사용하고 비례 비율로 변수가 어떻게 변하는 지 측정하고 싶습니다. 보다 상세하게는, 반응 변수는 다수의 부위에서 곤충 종의 존재 횟수이므로, 예를 들어 …


1
열차 / 유효 / 테스트 세트의 평균 빼기에 대한 질문
데이터 전처리를하고 데이터에 Convonets를 구축하려고합니다. 내 질문은 : 100 개의 이미지가있는 총 데이터 세트가 있고 100 개의 이미지 중 하나에 대한 평균을 계산 한 다음 각 이미지에서 뺀 다음 기차와 유효성 검사 세트로 나눕니다. 주어진 테스트 세트에서 처리하는 단계이지만 다음 링크에 따라 올바른 방법이 아닌 것 같습니다 : http://cs231n.github.io/neural-networks-2/#datapre " …

2
AR ( ) 모형에 대한 편견 추정치
AR ( ) 모델을 고려하십시오 ( 간단 성을 위해 평균이 0이라고 가정).피pp 엑스티=φ1엑스t - 1+ … +φ피엑스t - p+ε티xt=φ1xt−1+…+φpxt−p+εt x_t = \varphi_1 x_{t-1} + \dotsc + \varphi_p x_{t-p} + \varepsilon_t 대한 OLS 추정기 ( 조건부 최대 우도 추정량에 는 최근 스레드에 표시된 것처럼 바이어스 된 것으로 알려져 있습니다 .φ : …

1
이진 계측기 및 이진 내생 변수를 사용하여 계측 변수 회귀 분석의 2 단계 계수를 해석하는 방법은 무엇입니까?
(정말 긴 글입니다. 죄송합니다. 배경 정보가 많이 포함되어 있으므로 하단의 질문으로 건너 뛰어도됩니다.) 소개 : 저는 이진 내생 변수 이 지속적인 결과 에 미치는 영향을 확인하려는 프로젝트를 진행하고 있습니다. 우리는 임의로 할당 된 것으로 강력하게 믿고 있는 도구 .엑스1x1x_1와이yy지1z1z_1 데이터 : 데이터 자체는 약 34,000 개의 관측치가 1000 개 단위와 …

4
수치 최적화 기술로 Gradient descent vs Monte Carlo를 사용하는 경우
일련의 방정식을 분석적으로 해결할 수 없으면 그래디언트 디센트 알고리즘을 사용할 수 있습니다. 그러나 분석 솔루션이없는 문제를 해결하는 데 사용할 수있는 Monte Carlo 시뮬레이션 방법도 있습니다. 그라디언트 디센트 사용시기와 몬테 카를로 사용시기를 어떻게 알 수 있습니까? 아니면 '시뮬레이션'이라는 용어를 '최적화'와 혼동하고 있습니까? 대단히 감사합니다!

2
두 개의 독립적 정규 랜덤 변수의 최대 (최소) 분포는 무엇입니까?
구체적으로, 와 가 정규 랜덤 변수 (독립적이지만 반드시 동일하게 분포 된 것은 아님 )라고 가정하십시오 . 특정 주어지면 또는 유사한 개념에 대한 좋은 공식이 있습니까? 우리는 것을 알고 계십니까 최대가 (X, Y)는 \ 정상적으로에 대한 사람들의 관점에서 평균과 표준 편차, 어쩌면 공식 배포되는 X 및 Y ? 나는 일반적인 장소 …

2
매우 비뚤어진 카운트 데이터의 클러스터링 : 수행 할 제안 (변환 등)이 있습니까?
기본 문제 기본 문제는 다음과 같습니다. 매우 치우친 변수가 포함 된 데이터 세트를 개수로 묶으려고합니다. 변수는 많은 0을 포함하므로 클러스터링 절차에 대한 정보가 많지 않습니다. k- 평균 알고리즘 일 가능성이 큽니다. 예를 들어, 제곱근, 박스 콕스 또는 로그를 사용하여 변수를 변환하면됩니다. 그러나 내 변수는 범주 형 변수를 기반으로하기 때문에 변수를 …

1
크로스 테이블 분석을위한 테스트 : Boschloo 또는 Barnard?
30 명의 작은 환자 데이터 세트에서 2x2 테이블을 분석하고 있습니다. 우리는 어떤 치료법을 선택해야하는지에 대한 힌트를주는 변수를 찾기 위해 소급 적으로 노력하고 있습니다. 변수 (정상 / 이상한 것) 및 처리 결정 (A / B)에 특별한 관심이 있으므로 데이터는 다음과 같습니다. Obs / Tr. 12 월표준이상한ㅏ12012비1351825530Obs / Tr. 12 월ㅏ비표준121325이상한055121830\begin{array} {|r|r|r|r|} …

3
음 이항 GLM의 "정수가 아닌"경고를 처리하는 방법은 무엇입니까?
부정적인 이항 모델을 사용하여 R의 숙주에 영향을 미치는 기생충의 평균 강도를 모델링하려고합니다. 다음과 같은 경고가 계속 50 개 이상 나타납니다. In dpois(y, mu, log = TRUE) : non-integer x = 251.529000 이 문제를 어떻게 처리 할 수 ​​있습니까? 내 코드는 다음과 같습니다 mst.nb = glm.nb(Larvae+Nymphs+Adults~B.type+Month+Season, data=MI.df)

1
음 이항 분포에 대한 최대 가능성 추정기
문제는 다음과 같습니다. 모수 k = 3 인 음 이항 분포에서 n 값의 랜덤 표본을 수집합니다. 모수 π의 최대 우도 추정값을 찾습니다. 이 추정기의 표준 오차에 대한 점근 공식을 찾으십시오. 모수 k가 충분히 크면 음 이항 분포가 왜 정규 분포인지를 설명하십시오. 이 정규 근사의 매개 변수는 무엇입니까? 내 작업은 다음과 …

2
차이 방법의 차이 : 치료와 통제 그룹 사이의 일반적인 추세 가정을 테스트하는 방법?
이전 스레드 의 의견 에 따라 차이의 차이 방법에서 처리 그룹과 제어 그룹 간의 공통 추세 가정을 테스트하는 방법을 알고 싶습니다. 두 가지 시점 (예 : 2002 년 기준 조사, 2002 년에서 2006 년 사이의 치료, 2006 년의 후속 조사)으로이 가정을 테스트 할 수 있습니까? 대단히 감사합니다! 편집 :이 질문을 …

4
차원의 저주 : kNN 분류기
Kevin Murphy의 저서 : Machine Learning-A Probabilistic Perspective를 읽고 있습니다. 첫 번째 장에서 저자는 차원의 저주를 설명하고 있으며 이해하지 못하는 부분이 있습니다. 예를 들어 저자는 다음과 같이 말합니다. 입력이 D 차원 단위 큐브를 따라 균일하게 분포되어 있다고 가정하십시오. 원하는 분수를 포함 할 때까지 x 주위에 하이퍼 큐브를 성장시켜 클래스 레이블의 …


2
증분 가우스 프로세스 회귀
스트림을 통해 하나씩 도착하는 데이터 포인트 위에 슬라이딩 창을 사용하여 증분 가우시안 프로세스 회귀를 구현하고 싶습니다. 하자 입력 공간의 차원을 나타낸다. 따라서, 모든 데이터는 지적 갖는 원소의 수.dddxixix_iddd 슬라이딩 윈도우의 크기를 이라고하자 .nnn 예측을하기 위해 그램 행렬 의 역수를 계산해야합니다 . 여기서 이고 k는 제곱 지수 커널입니다.KKKKij=k(xi,xj)Kij=k(xi,xj)K_{ij} = k(x_i, x_j) …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.