통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
임계 베타 분포를 효율적으로 샘플링
다음 분포에서 어떻게 효율적으로 샘플링해야합니까? x∼B(α,β), x>k엑스∼비(α,β), 엑스>케이 x \sim B(\alpha, \beta),\space x > k 경우 너무 크지도 않고 다음 거부 샘플링은 가장 좋은 방법이 될 수 있지만, 나는 확실하지 때 진행 방법입니다 크다. 아마도 적용 할 수있는 점근 적 근사가 있습니까?kk케이kk케이k

1
랜덤 포리스트 결과가 왜 이렇게 가변적입니까?
두 그룹 사이에서 샘플을 분류하는 임의의 포리스트 기능을 테스트하려고합니다. 분류에 사용되는 54 개의 샘플과 다양한 변수가 있습니다. 내가 5 만 그루의 나무를 사용하는 경우에도 가방 외부 (OOB) 추정치가 서로 5 % 정도 차이가 나는 이유가 궁금합니다. 이것이 부트 스트랩이 도움이 될 수있는 것입니까?


1
시계열 예측을위한 랜덤 포레스트 회귀
제지 공장의 성능을 예측하기 위해 RF 회귀를 사용하려고합니다. 나는 기계 (종이 생산, 기계가 끌어 낸 전력)의 성능뿐만 아니라 입력 (속도 및 목재 펄프의 양 등 ...)에 대한 분 단위 데이터를 가지고 있으며 10 분을 예측하려고합니다. 성능 변수에 앞서. 12 개월의 데이터를 얻었으므로 훈련 세트의 경우 11 개월과 테스트의 마지막 달로 …

3
0/10에서 0/20 비교
과제 달성률을 논의 할 때 20 회 시도 중 0 회가 10 회 시도 중 0 회보다 "나쁘다"는 것을 보여주는 방법이 있습니까?

2
Tensorflow`tf.train.Optimizer`는 어떻게 그라디언트를 계산합니까?
Tensorflow mnist 튜토리얼 ( https://github.com/tensorflow/tensorflow/blob/master/tensorflow/examples/tutorials/mnist/mnist_softmax.py )을 따르고 있습니다 . 튜토리얼은 tf.train.Optimizer.minimize(특히 tf.train.GradientDescentOptimizer)를 사용합니다 . 그라디언트를 정의하기 위해 인수가 전달되는 곳이 없습니다. 텐서 흐름은 기본적으로 수치 미분을 사용합니까? 당신이 할 수있는 것처럼 그라디언트를 전달하는 방법이 scipy.optimize.minimize있습니까?

3
교정을 측정하기위한 최상의 메트릭을 어떻게 선택합니까?
테스트 중심 개발을 프로그래밍하고 수행합니다. 코드를 변경 한 후 테스트를 실행합니다. 때때로 그들은 성공하고 때로는 실패합니다. 테스트를 실행하기 전에 테스트가 성공할 것이라는 신뢰를 위해 0.01에서 0.99 사이의 숫자를 기록합니다. 테스트의 성공 여부를 예측하는 데있어 개선되고 있는지 알고 싶습니다. 테스트가 월요일 또는 금요일에 성공할지 예측하는 것이 더 나은지 여부를 추적 할 …


1
어떤 상황에서 Wilcoxon의 Signed-Rank Test가 t-Test 또는 Sign Test보다 선호됩니까?
약간의 토론 (아래) 후에, 나는 집중된 질문에 대한 명확한 그림을 얻었습니다. 따라서 수정 된 질문이 있습니다. 그러나 일부 의견은 원래 질문과 관련이없는 것처럼 보일 수 있습니다. 것으로 보인다 t-테스트가 대칭 분포를 신속하게 수렴 것으로, 서명 순위 테스트가 대칭을 가정 하고, 즉, 대칭 배포 수단 / pseudomedians / 중간 값 사이에는 …

2
컨볼 루션 신경망이 다른 크기의 입력 이미지로 사용할 수 있습니까?
이미지 인식을 위해 컨볼 루션 네트워크를 만들고 있는데 크기가 다른 이미지를 입력 할 수 있는지 궁금합니다. 이 프로젝트에서 : https://github.com/harvardnlp/im2markup 그들은 말합니다 : and group images of similar sizes to facilitate batching 따라서 전처리 후에도 이미지의 크기는 여전히 다르므로 수식의 일부를 잘라 내지 않기 때문에 의미가 있습니다. 다른 크기를 사용하는 …

1
행렬 함수의 미분에 대한이 계산이 무엇을 정당화합니까?
Andrew Ng의 기계 학습 과정에서 그는 다음 공식을 사용합니다. ∇Atr(ABATC)=CAB+CTABT∇ㅏ티아르 자형(ㅏ비ㅏ티씨)=씨ㅏ비+씨티ㅏ비티\nabla_A tr(ABA^TC) = CAB + C^TAB^T 그는 다음과 같이 빠른 증거를 수행합니다. ∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB∇ㅏ티아르 자형(ㅏ비ㅏ티씨)=∇ㅏ티아르 자형(에프(ㅏ)ㅏ티씨)=∇∘티아르 자형(에프(∘)ㅏ티씨)+∇∘티아르 자형(에프(ㅏ)∘티씨)=(ㅏ티씨)티에프'(∘)+(∇∘티티아르 자형(에프(ㅏ)∘티씨)티=씨티ㅏ비티+(∇∘티티아르 자형(∘티)씨에프(ㅏ))티=씨티ㅏ비티+((씨에프(ㅏ))티)티=씨티ㅏ비티+씨ㅏ비\nabla_A tr(ABA^TC) \\ = \nabla_A tr(f(A)A^TC) \\ = \nabla_{\circ} tr(f(\circ)A^TC) + \nabla_{\circ}tr(f(A)\circ^T C)\\ =(A^TC)^Tf'(\circ) + (\nabla_{\circ^T}tr(f(A)\circ^T C)^T \\ = C^TAB^T + (\nabla_{\circ^T}tr(\circ^T)Cf(A))^T …

2
정렬 된 목록에 대한 분포
주문한 상품 목록이 있다고 가정 해보십시오. [a, b, c, ... x, y, z, ...] 위의 목록을 지원하여 일부 매개 변수 alpha가 적용되는 배포 제품군을 찾고 있습니다. alpha = 0의 경우 확률 1 을 첫 번째 항목에, 위를, 0을 나머지에 할당합니다 . 즉, 우리 가이 목록에서 샘플을 교체하면 항상을 얻습니다 a. …

2
조건부 평균 독립성은 OLS 추정기의 편견과 일관성을 의미합니다
다음 다중 회귀 모델을 고려하십시오.Y=Xβ+Zδ+U.(1)(1)Y=Xβ+Zδ+U.Y=X\beta+Z\delta+U.\tag{1} 여기서 는 열 벡터이며; 행렬; a column vector; 행렬; 열 벡터; 그리고 오류 항인 는 열 벡터입니다.YYYn×1n×1n\times 1XXXn×(k+1)n×(k+1)n\times (k+1)ββ\beta(k+1)×1(k+1)×1(k+1)\times 1ZZZn×ln×ln\times lδδ\deltal×1l×1l\times 1UUUn×1n×1n\times1 질문 제 강사, Econometrics 소개 교과서 제 3 판. James H. Stock 및 Mark W. Watson, p. 281 및 계량 경제학 : Honor …


2
올가미 로지스틱 회귀 분석에서 계수 유의성 검정
[A 비슷한 질문은 질문했다 여기에 아무 답변] 나는 L1 정규화 (Lasso logistic regression) 로 로지스틱 회귀 모델을 적합 시켰고 유의성에 대한 적합 계수를 테스트하고 p- 값을 얻고 싶습니다. 나는 Wald의 검정 (예를 들어)이 정규화없이 전체 회귀에서 개별 계수의 중요성을 검정하는 옵션이라는 것을 알고 있지만 Lasso에서는 일반적인 Wald 공식을 적용 할 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.