통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
주기적인 데이터에 맞는주기적인 스플라인
이 질문에 대한 의견 에서 사용자 @whuber는 주기적 데이터에 맞추기 위해 주기적 버전의 스플라인을 사용할 가능성을 인용했습니다. 이 방법, 특히 스플라인을 정의하는 방정식과 실제로 스플라인을 구현하는 방법에 대해 더 알고 싶습니다 (주로 R사용자이지만 MATLAB 또는 Python으로 필요할 수 있습니다). 또한 이것은 "좋은 것"이지만 삼각 다항식 피팅과 관련하여 가능한 장점 / …

1
PCA 고유 벡터가 아닌 벡터의 "고유 값"(설명 된 분산의 백분율)을 얻는 방법?
PCA가 제공하는 좌표 공간이 아니라 약간 다른 (회전) 벡터 세트에 대해 데이터 세트의 분산 백분율을 얻는 방법을 이해하고 싶습니다. set.seed(1234) xx <- rnorm(1000) yy <- xx * 0.5 + rnorm(1000, sd = 0.6) vecs <- cbind(xx, yy) plot(vecs, xlim = c(-4, 4), ylim = c(-4, 4)) vv <- eigen(cov(vecs))$vectors ee …

1
박스 플롯 노치와 Tukey-Kramer 간격
'R'의 상자 그림에서 "노치" 도움말 문서 ( 또는 원본 텍스트 )는 다음을 제공합니다. 두 플롯의 노치가 겹치지 않으면 두 중간 값이 다르다는 '강력한 증거'입니다 (Chambers et al, 1983, p. 62). 사용 된 계산에 대해서는 boxplot.stats를 참조하십시오. ' boxplot.stats '는 다음을 제공합니다. 노치 (요청 된 경우)는 +/- 1.58 IQR / sqrt …

3
테스트 오류의 CV 추정치가 실제 테스트 오류를 ​​과소 평가하는 이유는 무엇입니까?
테스트 오류의 k- 폴드 교차 검증 추정치가 일반적으로 실제 테스트 오류를 ​​과소 평가한다는 것을 이해합니다. 이것이 왜 그런지 혼란 스럽습니다. 학습 오류가 일반적으로 테스트 오류보다 낮은 이유를 알 수 있습니다. 오류를 추정하는 것과 동일한 데이터로 모델을 학습하기 때문입니다! 그러나 교차 검증의 경우에는 해당되지 않습니다. 오류를 측정하는 부분은 훈련 과정에서 제외됩니다. …

2
같은 학급에서 같은 이름을 가진 다섯 자녀의 확률
베이비 명명 포럼에서 예비 부모는 항상 제니퍼에 대한 두려움의 일부 버전을 반복합니다. "자녀는 자신의 이름을 가진 수업에서 5 명 중 하나가되기를 원하지 않습니다." 그것은 더 이상 그런 종류의 인기에 더 이상 이름이 오지 않으며, 심지어 제니퍼 열풍이 일어 났을 때에도 수업 중에 5 명을 얻지 못했습니다. 나는 이러한 부모의 이름 …

2
기대
하자 엑스1엑스1X_1 , 엑스2엑스2X_2 , ⋯⋯\cdots , 엑스디~ N( 0 , 1 )엑스디∼엔(0,1)X_d \sim \mathcal{N}(0, 1) 와 독립. X 4 의 기대는 무엇입니까 1엑스41( X21+ ⋯ + X2디)2엑스14(엑스12+⋯+엑스디2)2\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2} ? E를 쉽게 찾을 수 E ( X21엑스21+ ⋯ + X2디) = 1디이자형(엑스12엑스12+⋯+엑스디2)=1디\mathbb{E}\left(\frac{X_1^2}{X_1^2 + \cdots + X_d^2}\right) = …


1
n 정상 정규 변수의 최대 비율에 대한 예상 값
가정 에서 IID되는 과하게 나타내고 '번째 행 작은 소자 . 에서 두 연속 요소 간의 비율의 예상 최대 값을 어떻게 상한으로 지정할 수 있습니까? 즉, 상한을 어떻게 계산할 수 있습니까?X1,...,XnX1,...,XnX_1,...,X_nN(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)X(i)X(i)X_{(i)}iiiX1,...,XnX1,...,XnX_1,...,X_nX(i)X(i)X_{(i)} E[maxi=1,...,n−1(X(i+1)X(i))]E[maxi=1,...,n−1(X(i+1)X(i))]E\left[\max\limits_{i=1,...,n-1}\left(\frac{X_{(i+1)}}{X_{(i)}}\right)\right] 내가 찾은 문헌은 주로 두 개의 임의 변수 사이의 비율에 초점을 맞추고 있으며, 두 개의 상관 관계없는 정규 분포에 …

2
입자 필터를 이해하기위한 수학적 및 통계적 전제 조건?
저는 현재 입자 필터와 재무 분야에서 가능한 용도를 이해하려고 노력하고 있으며 상당히 어려움을 겪고 있습니다. (i) 입자 필터의 기본에 접근 할 수 있도록하기 위해 (ii) 나중에 철저히 이해하기 위해 다시 방문해야하는 수학적 및 통계적 전제 조건은 무엇입니까? 아직 다루지 않은 상태 공간 모델을 제외하고 대학원 수준 시계열 계량 계에 대한 …


3
신경망을 훈련시켜 특정 스타일로 그림을 그릴 수 있습니까?
신경망을 훈련시켜 특정 스타일로 그림을 그릴 수 있습니까? (따라서 이미지를 가져와 훈련 된 스타일로 다시 그립니다.) 그런 종류의 물건에 대해 승인 된 기술이 있습니까? DeepArt 알고리즘에 대해 알고 있습니다. 기본 이미지를 특정 패턴 (예 : vangoghify 이미지)으로 채우는 것이 좋지만, 입력 초상화에서 특정 스타일로 만화를 만드는 것과 같은 다른 것을 …

1
주문 통계를 통해 추정값을 백분위 수로 수렴 표시
하자 에서 샘플링 IID 랜덤 변수들의 시퀀스 일 알파 안정된 분포 파라미터와 입니다. α = 1.5 ,X1,X2,…,X3nX1,X2,…,X3nX_1, X_2, \ldots, X_{3n}α=1.5,β=0,c=1.0,μ=1.0α=1.5,β=0,c=1.0,μ=1.0\alpha = 1.5, \; \beta = 0, \; c = 1.0, \; \mu = 1.0 이제 시퀀스를 고려하십시오 . 여기서 , .Y1,Y2,…,YnY1,Y2,…,YnY_1, Y_2, \ldots, Y_{n}Yj+1=X3j+1X3j+2X3j+3−1Yj+1=X3j+1X3j+2X3j+3−1Y_{j+1} = X_{3j+1}X_{3j+2}X_{3j+3} - 1j=0,…,n−1j=0,…,n−1j=0, \ldots, n-1 …

1
Aov 모델에서 공변량의 순서를 변경할 때 p- 값의 의미가 변하는 이유는 무엇입니까?
482 개의 관측치 데이터 세트가 있습니다. data=Populationfull 3 개의 SNP에 대한 유전자형 연관 분석을 수행하려고합니다. 내 분석을 위해 모델을 작성하려고 시도하고 aov (y ~ x, data = ...)를 사용하여 Im. 하나의 특성에 대해 다음과 같이 모델에 포함 된 여러 고정 효과 및 공변량이 있습니다. Starts <- aov(Starts~Sex+DMRT3+Birthyear+Country+Earnings+Voltsec+Autosec, data=Populationfull) summary(Starts) Df …
10 r  anova 

2
기능 선택에만 LASSO 사용
기계 학습 수업에서 LASSO 회귀 분석이 정규화를 사용하기 때문에 기능 선택을 수행하는 방법에 대해 매우 잘 .l1l1l_1 내 질문 : 사람들은 일반적으로 기능 선택을 수행하기 위해 LASSO 모델을 사용합니까 (그리고 다른 기계 학습 모델에 해당 기능을 덤프하도록 진행합니까) 아니면 일반적으로 기능 선택과 실제 회귀를 모두 수행하기 위해 LASSO를 사용합니까? 예를 …

2
두 샘플에 대한 쿨백-라이 블러 발산
두 샘플에 대해 Kullback-Leibler Divergence의 수치 추정을 구현하려고했습니다. 구현을 디버그하려면 두 정규 분포 엔( 0 , 1 )엔(0,1)\mathcal N (0,1) 및 에서 샘플을 가져옵니다 .엔( 1 , 2 )엔(1,2)\mathcal N (1,2) 간단한 추정을 위해 두 개의 히스토그램을 생성하고 수치 적으로 근사치를 근사하려고했습니다. 히스토그램 중 하나의 빈이 0 인 히스토그램의 해당 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.