통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
잘린 SVD를 계산하기 위해 어떤 빠른 알고리즘이 있습니까?
아마도 여기서는 주제에서 벗어 났지만 이미 몇 가지 ( 1 , 2 ) 관련 질문이 있습니다. 문헌 (또는 잘린 SVD 알고리즘에 대한 구글 검색)에서 주변에 파고 것은 논문이 많이 변합니다 사용 다양한 방법으로 잘립니다 SVDs, 그리고 주장 거기를 계산하는 빠른 알고리즘이 있지만, 아무도 그 (자주 인용하지 않고, 절망적를) 그 알고리즘이 …

5
분석 배경이없는 수학적 통계 경로 : 자체 학습을위한 이상적인 교과서
저학년에 수학 6 학기를 받았지만 상당히 수학적으로 기울어졌지만 부분적인 미분 방정식과 경로 적분으로 인해 개념이 약간 연습되었습니다. 나는 수학적 증거 (수학적 사고) 나 분석에 관한 코스를 가지지 않았습니다. 또한 대학원 수준의 확률을 이해합니다. 공식적으로 공부하고 최근에 제 지식을 새롭게했습니다. 통계와 통계 학습에 관한 대학원 과정도 몇 개있었습니다. 저는 개인적으로 관심을 …

2
데이터 변환 : 모든 변수 또는 비정규 변수?
Andy Field의 SPSS를 사용한 통계 발견에서 그는 모든 변수를 변환해야한다고 말합니다. 그러나 간행물 : "지리적 가중 회귀 I : 모델 설계 및 평가를 사용하여 토지 이용과 수질 사이의 공간적으로 다양한 관계를 조사하는 것"은 비정규 변수 만 변형되었다고 구체적으로 언급합니다. 이 분석은 구체적입니까? 예를 들어, 평균을 비교할 때 로그를 원시 데이터와 …

2
Python의 von Mises-Fisher 배포에서 샘플링?
파이썬에서 다변량 von Mises-Fisher 분포 에서 샘플링하는 간단한 방법을 찾고 있습니다. scipy 및 numpy 모듈 의 통계 모듈을 살펴 보았지만 일 변량 폰 미제스 분포 만 찾았습니다. 사용 가능한 코드가 있습니까? 아직 찾지 못했습니다. 분명히 Wood (1994)는 이 링크 에 따라 vMF 배포에서 샘플링하기위한 알고리즘을 설계 했지만 논문을 찾을 수 …

3
다른 곡선에 맞게 데이터 계열의 세그먼트를 프로그래밍 방식으로 감지하려면 어떻게해야합니까?
주어진 데이터 집합의 섹션을 가장 적합한 곡선으로 분리하는 문서화 된 알고리즘이 있습니까? 예를 들어,이 데이터 차트를 보는 대부분의 인간은 정현파 세그먼트, 선형 세그먼트 및 역 지수 세그먼트의 세 부분으로 쉽게 나눌 수 있습니다. 사실, 나는 이것을 사인파, 선 및 간단한 지수 공식으로 만들었습니다. 이와 같은 부품을 찾기위한 기존 알고리즘이 있습니까? …

3
OLS 추정기를 도출하기위한 가정
누군가 OLS 추정기를 계산하기 위해 6 가지 가정 각각이 필요한 이유를 간단히 설명해 줄 수 있습니까? 나는 다중 공선성에 대해서만 발견했습니다. 그것이 존재한다면 우리는 (X'X) 행렬을 뒤집을 수 없으며 전체 추정량을 추정 할 수 없습니다. 다른 것들은 어떻습니까 (예 : 선형성, 제로 평균 에러 등)?

3
힌지 손실 대 물류 손실의 장단점
힌지 손실을 이용하여 정의 될 수있는 및 로그 손실로 정의 될 수 로그 ( 1 + EXP ( - Y I w T는 X I를 ) )max(0,1−yiwTxi)max(0,1−yiwTxi)\text{max}(0, 1-y_i\mathbf{w}^T\mathbf{x}_i)log(1+exp(−yiwTxi))log(1+exp⁡(−yiwTxi))\text{log}(1 + \exp(-y_i\mathbf{w}^T\mathbf{x}_i)) 다음과 같은 질문이 있습니다. 힌지 손실의 단점이 있습니까 (예 : http://www.unc.edu/~yfliu/papers/rsvm.pdf에 언급 된 특이 치에 민감 함 )? 하나와 다른 …

4
표본 크기가 매우 클 때 신뢰 구간
내 질문은 특히 저널 간행물에 대해 "빅 데이터를 사용하여 샘플링 오류를 평가하는 방법"으로 표현할 수 있습니다. 다음은 도전 과제를 설명하는 예입니다. 매우 큰 데이터 세트 (100000 개 병원에서 100 만 명 이상의 고유 환자 및 처방약)에서 특정 약물을 복용하는 환자의 비율을 추정하는 데 관심이있었습니다. 이 비율을 얻는 것은 간단합니다. n이 …

1
혼합 효과 모델이 종속성을 해결하는 이유는 무엇입니까?
학생 시험 성적이 해당 학생이 공부하는 시간의 수에 어떻게 영향을 받는지 관심이 있다고 가정 해 봅시다. 이 관계를 탐색하기 위해 다음 선형 회귀 분석을 실행할 수 있습니다. exam.gradesi=a+β1×hours.studiedi+eiexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i 그러나 여러 학교에서 학생들을 채취하면 같은 학교의 학생들이 다른 학교의 학생들보다 서로 더 …

1
왜 지연 효과를 추가하면 베이지안 계층 모델에서 평균 편차가 발생합니까?
배경 : 현재 다양한 베이지안 계층 모델을 비교하는 작업을하고 있습니다. 데이터 는 참가자 i 및 시간 j 에 대한 웰빙의 숫자 측정 값입니다 . 참가자 당 약 1000 명의 참가자와 5 ~ 10 개의 관측치가 있습니다.와이나는 j와이나는제이y_{ij}나는나는i제이제이j 대부분의 종단 데이터 셋과 마찬가지로, 시간에 더 가까운 관측치가 더 멀리 떨어져있는 관측치보다 …

2
GLM : 분배 및 링크 기능 선택 확인
가우시안 분포 및 로그 링크 기능을 채택한 일반화 선형 모형이 있습니다. 모델을 피팅 한 후 QQ 플롯, 잔차 대 예측값, 잔차 히스토그램 (적당한주의가 필요함을 인정)을 잔차를 확인합니다. 모든 것이 좋아 보인다. 이것은 가우시안 분포의 선택이 상당히 합리적이라고 제안합니다. 또는 적어도 잔차가 모형에 사용 된 분포와 일치해야합니다. Q1 : 내가 선택한 …

1
로지스틱 회귀와 서포트 벡터 머신의 차이점은 무엇입니까?
로지스틱 회귀 분석에서 훈련 샘플을 분리하는 초평면을 찾습니다. 또한 Support 벡터 머신은 최대 마진을 가진 하이퍼 플레인을 찾습니다. 내 질문 : 로지스틱 회귀 (LR)와 서포트 벡터 머신 (SVM)의 차이점은 LR이 훈련 샘플을 분리하는 하이퍼 플레인을 찾는 반면 SVM은 최대 마진을 가진 하이퍼 플레인을 찾는 것입니까? 아니면 내가 틀렸어? 참고 : …

2
caret와 기본 randomForest 패키지를 통한 randomForest의 다른 결과
약간 혼란 스러워요 : 캐럿을 통한 훈련 된 모델의 결과는 원래 패키지의 모델과 어떻게 다를 수 있습니까? 캐럿 패키지와 함께 RandomForest의 FinalModel을 사용하여 예측 전에 사전 처리가 필요한지 여부를 읽습니다 .그러나 나는 여기서 전처리를 사용하지 않습니다. 캐럿 패키지를 사용하고 다른 mtry 값을 조정하여 다른 임의의 포리스트를 학습했습니다. > cvCtrl = …

1
우리는 언제 Quantiles와 Median 대신에 tantile과 medial을 사용할 것입니까?
Wikipedia 또는 Wolfram Mathworld에서 탄탈 또는 내측에 대한 정의를 찾을 수 없지만 다음 설명은 Bílková, D. 및 Mala, I. (2012), " 소득 분포를 모델링 할 때 L- 모멘트 방법 적용 체코 공화국 ", 통계의 오스트리아 저널 , 41 (2), 125-132. 내측은의 값 , 샘플이 중간 값에 해당하는 것처럼 (샘플) tantile …

1
스택 형 오토 인코더와 2 계층 신경망 훈련간에 차이가 있습니까?
2 레이어 스택 형 자동 인코더와 2 레이어 신경망을 구축하는 알고리즘을 작성한다고 가정 해 봅시다. 그것들이 같은 것입니까 아니면 차이점입니까? 내가 이해하는 것은 누적 된 자동 인코더를 빌드 할 때 레이어별로 빌드한다는 것입니다. 신경망의 경우, netowork의 모든 매개 변수를 초기화 한 다음 각 데이터 포인트에 대해 네트워크를 통해 전달하고 손실 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.