통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
감마와 카이 제곱 분포의 관계
만약 곳 , 즉 모든 동일한 분산과 평균 제로의 IID 정상 랜덤 변수이고, 그런 다음Y=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2)XiXiX_iY∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). 카이 제곱 분포가 감마 분포의 특수한 경우이지만 랜덤 변수 대한 카이 제곱 분포를 도출 할 수 없다는 것을 알고 있습니다. 도와주세요?YYY

1
데이터를 원하는 평균 및 표준 편차로 변환
데이터 세트를 현재 평균 및 표준 편차에서 목표 평균 및 목표 표준 편차로 변환하는 방법을 찾고 있습니다. 기본적으로 분산을 축소 / 확장하고 모든 숫자를 평균으로 스케일링하려고합니다. 표준 편차와 평균에 각각 하나씩 두 개의 선형 변환을 수행하는 것은 효과가 없습니다. 어떤 방법을 사용해야합니까? 데이터 세트의 평균을 0.5로, SD를 0.1667으로 조정할 때 …

3
정규화 된 그라디언트 및 그라디언트 사용의 차이점
그래디언트 디센트 알고리즘의 일반적인 설정에는 여기서 은 현재 점이고 는 단계 크기이고 은 그래디언트입니다. 에서 평가되었습니다 . x n η g r a d i e n t x n x nxn+1=xn−η∗gradientxnxn+1=xn−η∗gradientxnx_{n+1} = x_{n} - \eta * gradient_{x_n}xnxnx_nηη\eta지r a d난 전자 N t를엑스엔gradientxngradient_{x_n}xnxnx_n 일부 알고리즘에서 사람들은 gradient 대신 normalized gradient를 …

2
분포에서 자유도에 대한 좋은 사전 분포는 무엇입니까?
베이지안 모델에서 짧은 간격 자산 수익을 모델링하기 위해 배포시 사용하고 싶습니다. 분포에 대한 자유도 (모델의 다른 매개 변수와 함께)를 추정하고 싶습니다. 나는 자산 수익률이 정상적이지 않다는 것을 알고 있지만, 그 이상을 너무 많이 모른다. 그러한 모형에서 자유도에 대한 적절하고 약간 유익한 사전 분포는 무엇입니까?

1
logloss vs gini / auc
두 가지 모델 (h2o AutoML을 사용하는 이진 분류기)을 훈련했으며 사용할 모델을 선택하려고합니다. 다음과 같은 결과가 있습니다. model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 auc과 logloss열이 교차 유효성 검사 측정 항목 (교차 검증은 훈련 데이터를 사용). ..._train및 …


2
scikit-learn 부트 스트랩 기능이 테스트 세트를 다시 샘플링하는 이유는 무엇입니까?
모델 평가에 부트 스트랩을 사용할 때 항상 가방 외부 샘플이 테스트 세트로 직접 사용되었다고 생각했습니다. 그러나 이것은 더 이상 사용되지 않는 scikit-learnBootstrap 접근법 의 경우가 아닌 것으로 보입니다. 이것에 대한 통계적 추론은 무엇입니까? 이 기술이 백 오브 샘플을 평가하는 것보다 좋은 특정 시나리오가 있습니까?

1
표준화 된 베타를 원래 변수로 다시 변환
나는 이것이 매우 간단한 질문이라는 것을 알고 있지만 검색 후 내가 찾고있는 답변을 찾을 수 없습니다. 베타의 능선 추정값을 계산하기 위해 변수 (릿지 회귀)를 실행하는 변수를 표준화 해야하는 문제가 있습니다. 그런 다음이를 원래 변수 척도로 다시 변환해야합니다. 하지만 어떻게해야합니까? 이변 량 사례에 대한 공식을 찾았습니다. β∗=β^SxSy.β∗=β^SxSy. \beta^* = \hat\beta \frac{S_x}{S_y} …

4
무작위 범주 형 데이터를 생성하는 방법?
값 A, B, C 및 D를 취할 수있는 범주 형 변수가 있다고 가정 해 봅시다. 10000 개의 임의의 데이터 포인트를 생성하고 각각의 빈도를 제어하는 ​​방법은 무엇입니까? 예를 들면 다음과 같습니다. A = 10 % B = 20 % C = 65 % D = 5 % 내가 어떻게 할 수있는 …

2
영향 함수 및 OLS
영향력 기능이 어떻게 작동하는지 이해하려고 노력하고 있습니다. 간단한 OLS 회귀와 관련하여 누군가 설명 할 수 있습니까? yi=α+β⋅xi+εiyi=α+β⋅xi+εi\begin{equation} y_i = \alpha + \beta \cdot x_i + \varepsilon_i \end{equation} 대한 영향 함수 를 원합니다 .ββ\beta

1
머신 러닝 모델의 "용량"은 무엇입니까?
Carl Doersch의 Variational Autoencoders에 대한 이 자습서를 공부하고 있습니다. 두 번째 페이지에는 다음과 같이 표시됩니다. 가장 인기있는 프레임 워크 중 하나는이 자습서의 주제 인 Variational Autoencoder [1, 3]입니다. 이 모델의 가정은 약하고 역 전파를 통해 훈련이 빠릅니다. VAE는 근사값을 계산하지만이 근사값으로 인한 오차는 고용량 모델을 감안할 때 매우 작습니다 . …


1
RNN : BPTT 및 / 또는 업데이트 가중치 적용시기
음소 분류 에 관한 Graves의 2005 논문을 통해 시퀀스 레이블링에 RNN을 적용하는 방법을 이해하려고합니다 . 문제 요약 : 단일 문장의 (입력) 오디오 파일과 전문가 레이블이 지정된 시작 시간, 중지 시간 및 개별 음소에 대한 레이블 (무음, 각 오디오 파일의 각 샘플에는 음소 기호가 표시됩니다.) 이 논문의 핵심은 숨겨진 레이어에 LSTM …
15 lstm  rnn 



당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.