통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
간단한 퍼셉트론을 커널 화하는 방법?
비선형 경계의 분류 문제는 단순한 퍼셉트론 으로 해결할 수 없습니다 . 다음 R 코드는 설명을위한 것이며 Python 의이 예제 를 기반으로합니다 . nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X <- matrix(c(-3,1, -2,1, -1,1, 0,1, 1,1, 2,1, 3,1), ncol=2, byrow=T) y <- c(0,0,1,1,1,0,0) syn0 …

2
카운트 데이터로 스케일 변수-맞습니까?
에서 본 논문 (중앙 PubMed를 통해 자유롭게 사용할 수), 저자는 0-40 득점 10 항목 심사 악기의 점수를 모델링하는 음 이항 회귀 분석을 사용합니다. 이 절차에서는 카운트 데이터를 가정하지만 여기에는 해당되지 않습니다. 이 접근법이 수용 가능한지 아닌지에 대한 당신의 의견을 부탁드립니다. 나는 때때로 내 작품에서 같은 악기 나 유사한 도구를 사용하기 …

4
선형 분류기로 과적 합
오늘 우리 교수는 수업에서 "선형 분류기로 과적 합하는 것은 불가능하다"고 말했습니다. 선형 분류 자조차도 훈련 세트의 특이 치에 민감 할 수 있기 때문에 잘못 알고 있습니다. 아니면 내가 틀렸어? 분명히, 선형성은 아마도 모델 복잡성이 낮아서 오버 피팅을 방지 할 수 있지만 여전히 오버 피팅이 불가능한 이유는 알 수 없습니다. 한 …

2
내 네트워크 (그래프)가 "소규모"네트워크인지 여부를 통계적으로 테스트하는 방법은 무엇입니까?
작은 세계 네트워크는 대부분의 노드가 서로의 이웃되지 않는 수학적 그래프의 일종이지만, 대부분의 노드는 홉 또는 단계의 소수에 의해 다른 모든에서 도달 할 수 있습니다. 구체적으로, 소규모 세계 네트워크는 무작위로 선택된 두 노드 사이의 전형적인 거리 L (필요한 단계 수)이 네트워크에서 노드 수 N의 로그에 비례하여 증가하는 네트워크로 정의됩니다. L ≈ …

1
우도 함수를 다시 매개 변수화 할 때 변수 변경 공식 대신 변환 된 변수를 연결하는 것만으로 충분합니까?
기하 급수적으로 분포 된 우도 함수를 다시 매개 변수화하려고한다고 가정하십시오. 내 원래 우도 ​​함수가 다음과 같은 경우 : p ( y∣ θ ) = θ e− θ yp(y∣θ)=θe−θy p(y \mid \theta) = \theta e^{-\theta y} 나는 싶습니다 다시 변수화가 사용하는 , 이후 아닙니다 확률 변수지만, 매개 변수, 그냥 플러그인에 충분하다? …

2
로지스틱 모델의 RMSE (Root Mean Squared Error)
다른 물류 모델을 비교하기 위해 RMSE (Root Mean Squared Error)를 사용하는 유효성에 관한 질문이 있습니다. 응답은 0또는 1이고 예측은 0- 1? 이진 반응에도 아래의 방법이 적용됩니까? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) cvfit = cv.glmnet(x, y, family = "binomial", type.measure = "mse") A <- predict(cvfit, newx = x, s = …

1
그래프 커널 SVM 하이퍼 파라미터 튜닝에는 어떤 방법이 있습니까?
그래프 에 존재하는 데이터가 있습니다 . 꼭짓점은 두 클래스 중 하나에 속하며 두 클래스 를 구별하기 위해 SVM을 훈련시키는 데 관심이 있습니다. 이것에 대한 하나의 적절한 커널은 인 확산 커널 , 는 IS 라플라시안 의 및 튜닝 파라미터이다.y i ∈ { − 1 , 1 }G = ( V, E)G=(V,E)G=(V,E)와이나는∈ …

1
이 추정기의 분산은 무엇입니까
함수 f의 평균, 즉 의 평균을 추정하고 싶습니다 여기서 와 는 독립적 인 랜덤 변수입니다. 나는 F의 샘플을 가지고 있지만 IID하지 : 대한 IID 샘플이 있습니다 하고 각 있다 에서 샘플 :EX,Y[f(X,Y)]EX,Y[f(X,Y)]E_{X,Y}[f(X,Y)]XXXYYYY1,Y2,…YnY1,Y2,…YnY_1,Y_2,\dots Y_nYiYiY_ininin_iXXXXi,1,Xi,2,…,Xi,niXi,1,Xi,2,…,Xi,niX_{i,1},X_{i,2},\dots, X_{i,n_i} 총 샘플f(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X_{1,1},Y_1) \dots f(X_{1,n_1},Y_1 ) \dots f(X_{i,j},Y_i) \dots f(X_{n,n_n},Y_n) 평균을 계산하려면 분명히 그래서 공평 추정기이다. 무엇인지 …

4
n 개의 균일하게 분포 된 r.v가 주어진 경우, 하나의 rv에 대한 PDF를 모든 n r.v의 합으로 나눈 값은 무엇입니까?
다음과 같은 유형의 사례에 관심이 있습니다. 'n'연속 랜덤 변수는 1이어야합니다. 그런 다음 개별 변수 하나에 대한 PDF는 무엇입니까? 따라서 이면 의 분포에 관심이 있습니다. 여기서 및 은 모두 균일하게 분포됩니다. 물론이 예제 에서 평균 은 이며 평균은 이므로 R의 분포를 시뮬레이션하기는 쉽지만 PDF 또는 CDF의 실제 방정식이 무엇인지 알 수 …
10 uniform 

2
데이터 평균화와 데이터 피팅 및 피팅, 평균화의 차이점
여러 개별 "실험"에 라인을 맞추는 것 사이에 적합을 평균화하거나 별도의 실험에서 데이터를 평균화 한 다음 평균 데이터를 피팅합니다. 좀 더 자세히 설명하겠습니다 : 아래 그림과 같이 곡선을 생성하는 컴퓨터 시뮬레이션을 수행합니다. 수량을 추출하고 플롯의 선형 영역 (장시간)을 피팅하여 "A"라고합니다. 값은 단순히 선형 영역의 기울기입니다. 물론이 선형 회귀와 관련된 오류가 있습니다. …
10 error  fitting  average 


3
G- 검정 대 피어슨의 카이 제곱 검정
비상 테이블 에서 독립성을 테스트하고 있습니다. G 테스트 또는 Pearson 카이 제곱 테스트가 더 좋은지 모르겠습니다 . 샘플 크기는 수백이지만 셀 수가 적습니다. Wikipedia 페이지 에 명시된 바와 같이 카이 제곱 분포에 대한 근사값은 Pearson 카이 제곱 검정보다 G- 검정에 더 좋습니다. 그러나 Monte Carlo 시뮬레이션을 사용하여 p- 값을 계산하고 …

3
로지스틱 회귀 분석에서 범주 형 예측 변수를 WOE 변환해야하는 이유는 무엇입니까?
범주 형 변수의 증거 가중치 (WOE) 변환은 언제 유용합니까? 이 예는 WOE 변환 에서 볼 수 있습니다 (따라서, 응답에 대한 ,와 범주 예측기 카테고리, 밖으로 성공 내의 시험 이 예측기의 범주 번째의 용 화가 번째 카테고리는 다음과 같이 정의된다yyykkkyjyjy_jnjnjn_jjjjjjj logyj∑kjyj∑kj(nj−yj)nj−yjlog⁡yj∑jkyj∑jk(nj−yj)nj−yj\log \frac{y_j} {\sum_j^k {y_j}} \frac{\sum_j^k (n_j-y_j)}{n_j-y_j} 변환은 범주 형 예측 변수의 …


1
대규모 PCA도 가능합니까?
PCA (Principal Component Analysis)의 고전적인 방법은 열의 평균이 0 인 입력 데이터 매트릭스에서 수행하는 것입니다 (PCA는 "분산을 최대화 할 수 있습니다"). 컬럼을 중심으로하여 쉽게 달성 할 수 있습니다. 그러나 입력 행렬이 희소 인 경우 중심 행렬은 더 이상 희소하므로 행렬이 매우 큰 경우 더 이상 메모리에 맞지 않습니다. 스토리지 문제에 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.