통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


1
월별 수익의 변동에 따른 연간 수익의 변동
나는 일련의 재무 수익률의 전체 차이 / 표준 오류를 이해하려고 노력하고 있으며, 붙어 있다고 생각합니다. 일련의 월간 주식 반환 데이터 ( 라고합시다 )는 가치가 1.00795이고 분산은 0.000228입니다 (표준 개발은 0.01512입니다). 나는 연간 수익률의 최악의 경우를 계산하려고합니다 (예상 값에서 표준 오류의 두 배를 뺀 것으로 가정하십시오). 가장 좋은 방법은 무엇입니까? . …

5
신경망을위한 수학적 배경
이것이이 사이트에 적합한 지 확실하지 않지만 컴퓨터 과학 (응용 수학 학사)에서 MSE를 시작하고 기계 학습에 대한 강력한 배경을 얻고 싶습니다 (박사 학위를 추구 할 것입니다). 내 관심사 중 하나는 신경망입니다. ANN에게 좋은 수학적 배경은 무엇입니까? 기계 학습의 다른 영역과 마찬가지로 선형 대수학이 중요하다고 생각하지만 다른 수학 영역은 무엇입니까? 신경망 : …


1
일반적인 보상 분배를위한 다중 무장 적기
보상 분배에 대한 정보가없는 다중 무기 산적 문제를 해결하고 있습니다. 나는 알려진 바운드가있는 배포판과 [0,1]에서 지원하는 일반적인 배포판에 대한 후회를 보증하는 많은 논문을 발견했다. 보상 배분이 지원에 대한 보증이없는 환경에서 잘 수행 할 수있는 방법이 있는지 알고 싶습니다. 비모수 공차 한계를 계산하려고 시도하고이 숫자를 사용하여 보상 분포를 조정하여이 백서에 지정된 …

1
다항식 대비 변수의 계산
범주 형 변수 (인수)를 직교 다항식 대비 변수 세트로 효율적으로 코딩하는 방법을 알려주십시오. 여러 유형의 대비 변수 (예 : 편차, 단순, Helmert 등)의 경우 패스는 다음과 같습니다. 대비 계수 행렬에 해당하는 형식을 구성하십시오. 코드 행렬을 얻기 위해 역 또는 일반화 역. 예를 들면 다음과 같습니다. Suppose there is 3-group factor …

2
공분산 행렬에 대한 메트릭 : 단점 및 장점
공분산 행렬에 대한 "최상의"메트릭은 무엇이며 그 이유는 무엇입니까? Frobenius & c가 적절하지 않으며 각도 매개 변수화에도 문제가 있음이 분명합니다. 직관적 으로이 두 가지 사이의 타협을 원할 수도 있지만 명심해야 할 다른 측면과 잘 확립 된 표준이 있는지 알고 싶습니다. 공통 메트릭에는 공분산 행렬이 자연스럽지 않기 때문에 여러 가지 단점이 있습니다. …

3
두 모수의 곱에 대한 신뢰 구간
과 두 매개 변수가 있다고 가정 해 봅시다 . 또한 두 개의 최대 우도 추정값 및 과 이러한 모수에 대한 두 개의 신뢰 구간이 있습니다. 대한 신뢰 구간을 구축하는 방법이 있습니까?p1p1p_1p2p2p_2p1^p1^\hat{p_1}p2^p2^\hat{p_2}p1p2p1p2p_1p_2

2
공분산 행렬을 만드는 변수 사이의 거리는 얼마입니까?
I는이 공분산 행렬와으로 분할 할 변수 사용하여 클러스터 계층 클러스터링 (공분산 행렬을 정렬하도록).n×nn×nn \times nkkk 변수 간 ​​(즉, 제곱 공분산 행렬의 열 / 행 사이) 일반적인 거리 함수가 있습니까? 또는 더 많은 것이 있으면 주제에 대한 좋은 참고 자료가 있습니까?

2
에 균일 분포를위한 유클리드 표준의 꼬리 경계
\ : \ {-n, ~-(n-1), ~ ..., ~ n-1, ~ n \} ^ d \ 의 균일하게 선택된 요소의 유클리드 표준이 얼마나 자주 상한이라고 알려져 있습니까 ?{−n, −(n−1), ..., n−1, n}d{−n, −(n−1), ..., n−1, n}d\:\{-n,~-(n-1),~...,~n-1,~n\}^d\: 주어진 임계 값보다 큽니까? 나는 nnn 이 d 보다 훨씬 작을 때 지수 적으로 0으로 …

1
회귀 계수의 샘플링 분포
이전에는 미지 모수의 관점에서 추정기에 대한 결과를 제공 한 분포 분포 샘플링에 대해 배웠습니다. 예를 들어, 선형 회귀 모델 에서 및 의 샘플링 분포β^0β^0\hat\beta_0β^1β^1\hat\beta_1Yi=βo+β1Xi+εiYi=βo+β1Xi+εiY_i = \beta_o + \beta_1 X_i + \varepsilon_i β^0∼N(β0, σ2(1n+x¯2Sxx))β^0∼N(β0, σ2(1n+x¯2Sxx)) \hat{\beta}_0 \sim \mathcal N \left(\beta_0,~\sigma^2\left(\frac{1}{n}+\frac{\bar{x}^2}{S_{xx}}\right)\right) 및 β^1∼N(β1, σ2Sxx)β^1∼N(β1, σ2Sxx) \hat{\beta}_1 \sim \mathcal N \left(\beta_1,~\frac{\sigma^2}{S_{xx}}\right) 여기서Sxx=∑ni=1(x2i)−nx¯2Sxx=∑i=1n(xi2)−nx¯2S_{xx} = …

1
패널 / 세로 데이터에 대한 예측 평가 지표
매월 수준에서 행동 예측을 제공하는 여러 가지 다른 모델을 평가하고 싶습니다. 데이터는 균형이 잡히고 100,000이고 T = 12입니다. 결과는 주어진 달에 콘서트에 참석하므로 한 달에 ~ 80 %의 사람들에게는 0이지만, 무거운 사용자의 긴 꼬리가 있습니다. 내가 예측 한 결과는 결과의 카운트 특성을 존중하지 않는 것 같습니다. 분수 콘서트가 만연합니다.n =n=n=티=T=T= …

2
t 테스트와 일원 분산 분석은 모두 Wald 테스트입니까?
정규 분포 된 표본의 평균이 상수와 같은지 여부를 검정하기위한 t- 검정은 표본 평균에서의 피셔의 정규 분포 정보에 의한 표본 평균의 표준 편차를 추정하여 Wald 검정이라고합니다. 그러나 t 검정의 검정 통계량에는 학생 t 분포가 있고, Wald 검정의 검정 통계량은 카이 제곱 분포입니다. 어떻게 설명해야합니까? 일원 분산 분석에서 검정 통계량은 클래스 간 …

2
특이 치를 탐지하기위한 IQR의 정확도
프로세스의 실행 시간을 분석하는 스크립트를 작성 중입니다. 배포가 확실하지 않지만 프로세스가 "너무 오래"실행되고 있는지 알고 싶습니다. 지금까지 마지막 실행 시간 (n> 30)의 3 표준 편차를 사용했지만 데이터가 정상이 아닌 경우 (그렇지 않은 것으로 보이는 경우) 유용한 것을 제공하지 않는다고 들었습니다. 나는 다른 이상치 테스트를 발견했다. 사 분위 간 범위 (IQR …


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.