통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
짧은 문서를위한 주제 모델
이 질문 에서 영감을 받아 , 매우 짧은 텍스트의 큰 컬렉션을 위해 주제 모델에 대한 작업이 수행되었는지 궁금합니다. 내 직감은 트위터가 그러한 모델에 대한 자연스러운 영감이어야한다는 것입니다. 그러나 일부 제한된 실험에서 표준 토픽 모델 (LDA 등)이 이런 종류의 데이터에서 성능이 좋지 않은 것으로 보입니다. 이 분야에서 수행 된 작업에 대해 …

5
탐색 요소 분석을 통해 R과 SPSS 간의 불일치 해석
저는 컴퓨터 공학 대학원생입니다. 나는 연구 프로젝트에 대한 탐색 적 요소 분석을 해왔다. 동료 (프로젝트를 이끌고있는)는 SPSS를 사용하지만 R을 사용하는 것을 선호합니다. 두 통계 패키지간에 큰 차이가있을 때까지는 문제가되지 않았습니다. 우리는 추출 방법으로 주축 인수 분해 를 사용하고 있습니다 (PCA와 요인 분석의 차이를 잘 알고 있으며 적어도 의도적으로는 PCA를 사용하지 …

2
다항 로지스틱 회귀 분석을 위해 glm 알고리즘을 사용할 수 있습니까?
프로젝트에서 통계 분석에 spotfire (S ++)를 사용하고 있으며 대규모 데이터 세트에 대해 다항 로지스틱 회귀 분석을 실행해야합니다. 가장 좋은 알고리즘은 mlogit 일 것입니다. 그러나 불행히도 s ++에서는 사용할 수 없습니다. 그러나이 회귀에 glm 알고리즘을 사용하는 옵션이 있습니다. 여기서 두 가지를 분명히하고 싶습니다. 1. glm을 사용하여 다항 로지스틱 회귀 분석을 실행할 …

2
로지스틱 회귀에 대한 질문
이진 로지스틱 회귀 분석을 실행하여 10 년 동안 (1997-2006) 독립 변수 집합에서 충돌 (종속 변수)의 존재 유무를 모델링하고 매년 107 개의 관측치를 얻습니다. 내 독립은 : 토지 분해 (2 가지 유형의 분해에 범주 적); 인구 증가 (0- 아니오; 1- 예); 생계 유형 (0-1 형; 1-2 형); 인구 밀도 (3 단계 …

2
다양한 기능을 가진 데이터 세트 다루기
다양한 수의 기능으로 데이터를 분류하는 방법에는 어떤 것이 있습니까? 예를 들어, 각 데이터 포인트가 x 및 y 포인트의 벡터이고 각 인스턴스에 대해 동일한 개수의 포인트가없는 문제를 고려하십시오. x와 y 포인트의 각 쌍을 특징으로 취급 할 수 있습니까? 또는 각 데이터 포인트에 고정 된 수의 기능이 있도록 포인트를 어떻게 든 요약해야합니까?

3
학교 어린이에게 통계 및 기계 학습에 대해 무엇을 말할 수 있습니까?
다음 주에 우리는 집에있는 지역 학교에서 인턴을하였습니다. 그의 짧은 인턴십의 개념은 실제 세계가 어떻게 작동하는지, 어떤 직업이 어떻게 처리하는지, 매일의 업무가 어떻게 보이는지 등을 이해하는 것입니다. 이제 나는 그런 어린 아이에게 통계 및 기계 학습에 대해 말하고 보여주고 설명 할 수있는 것이 무엇인지 궁금해했습니다. 이 분야의 기본 아이디어를 얻습니다 열광적이다 …

3
동적 추천 시스템
추천인 시스템은 그에게 관심을 가질만한 항목에 대한 특정 사용자에 대한 다른 사용자의 평가 및 수율 권고 사이의 상관 관계를 측정하는 것입니다. 그러나 시간이 지남에 따라 맛이 바뀌므로 오래된 등급 은 현재 환경 설정을 반영하지 않을 수 있으며 그 반대도 마찬가지입니다. 당신은 지금 당신이 "너무 역 겹지 않은"등으로 평가할 책에 "우수"를 …

1
다른 토폴로지에서 다른 추정기의 수렴 동작에 대해 논의해야하는 이유는 무엇입니까?
다른 기능 공간에서 추정의 수렴에 대해 이야기하는 대수 기하학 및 통계 학습 이론 책의 첫 번째 장 에서 베이지안 추정은 슈바르츠 분포 토폴로지에 해당하고 최대 가능성 추정은 정상 토폴로지에 해당한다고 언급합니다. (7 페이지) : 예를 들어, sup-norm, -norm, 엘피엘피L^pHilbert space 의 약한 토폴로지 엘2엘2L^2, Schwartz 배포 토폴로지 등이 있습니다. 수렴 …

2
기계 학습을 위해 범주 형 기능을 숫자로 인코딩
신경망과 같은 많은 기계 학습 알고리즘은 숫자를 처리 할 것으로 예상합니다. 따라서 범주 형 데이터가 있으면 변환해야합니다. 범주 적으로 말하자면, 예를 들어 : 자동차 브랜드 : Audi, BMW, Chevrolet ... 사용자 ID : 1, 25, 26, 28 ... 사용자 ID는 숫자이지만 레이블 일 뿐이며 연령이나 금액과 같은 연속성 측면에서 아무 …

1
모멘트 생성 기능
이 질문은 여기서 바운드 온 모멘트 생성 기능 (MGF)에 관한 질문 에서 발생합니다. 가정하자 의 값에 묶여 제로 평균 확률 변수의 복용 및하자 수를 그 MGF. A는에서 Hoeffding의 부등식의 증명에 사용 바운드 , 우리가 저 우측은 MGF로서 인식 할 표준 편차 제로 평균 정상 랜덤 변수 . 이제 의 표준 …

3
시계열 유사성을 결정하기 위해 동적 시간 왜곡을 설명 할 수 있습니까?
시계열을 비교하기위한 동적 시간 왜곡 측정을 파악하려고합니다. 다음과 같은 세 가지 시계열 데이터 집합이 있습니다. T1 <- structure(c(0.000213652387565, 0.000535045478866, 0, 0, 0.000219346347883, 0.000359669104424, 0.000269469145783, 0.00016051364366, 0.000181950509461, 0.000385579332948, 0.00078170803205, 0.000747244535774, 0, 0.000622858922454, 0.000689084895259, 0.000487983408564, 0.000224744353298, 0.000416449765747, 0.000308388157895, 0.000198906016907, 0.000179549331179, 9.06289650172e-05, 0.000253506844685, 0.000582896161212, 0.000386473429952, 0.000179839942451, 0, 0.000275608635737, 0.000622665006227, 0.00036075036075, 0.00029057097196, 0.000353232073472, 0.000394710874285, …

1
평등 및 불평등 제약에 대한 제약 최적화 라이브러리
최적화 기능에 적합한 제한된 최적화 라이브러리 선택에 대한 권장 사항이 있습니까? 나는 ai) 선형 평등과 불평등 제약으로 비선형 함수를 최소화하고 있으며 ii) 함수의 기울기와 헤 시안을 사용할 수 있습니다. 도움이된다면 최소화하고있는 기능은 Kullback-Liebler divergence 입니다. constrOptim 은 불평등 제약 조건 만 처리합니다. Quadprog 는 2 차를 처리합니다. 신뢰 는 제한 …

5
Weibull 분포를 0을 포함하는 입력 데이터에 맞추는 방법은 무엇입니까?
은퇴 한 연구원이 전달한 기존 예측 알고리즘을 재현하려고합니다. 첫 번째 단계는 일부 관측 된 데이터를 Weibull 분포에 맞추고 미래 값을 예측하는 데 사용할 모양과 스케일을 얻는 것입니다. R을 사용 하여이 작업을 수행하고 있습니다. 내 코드의 예는 다음과 같습니다. x<-c(23,19,37,38,40,36,172,48,113,90,54,104,90,54,157,51,77,78,144,34,29,45,16,15,37,218,170,44,121) f<-fitdistr(x, 'weibull') 입력 배열에 0이 없으면 제대로 작동하지 않으므로 제대로 작동합니다. …

4
"중재"와 "상호 작용"?
많은 맥락에서 상호 교환 적으로 사용되는이 두 용어를 접했습니다. 기본적으로 중재자 (M)는 X와 Y의 관계에 영향을주는 요소입니다. 보통 분석은 회귀 모델을 사용하여 수행됩니다. 예를 들어 성별 (M)은 "제품 조사"(X)와 "제품 구매"(Y)의 관계에 영향을 줄 수 있습니다. 상호 작용에서 X1과 X2는 Y에 영향을주기 위해 상호 작용합니다. 여기서 동일한 예는 "제품 조사"(X1)가 …

2
ARMA / ARIMA는 혼합 효과 모델링과 어떤 관련이 있습니까?
패널 데이터 분석에서, 임의 / 혼합 효과가있는 다중 레벨 모델을 사용하여 자동 상관 문제 (즉, 시간이 지남에 따라 개별적으로 관측 값이 군집 됨)를 처리하기 위해 시간과 충격의 일부 사양에 맞게 조정 된 다른 매개 변수를 추가했습니다. . ARMA / ARIMA는 비슷한 문제를 해결하기 위해 고안된 것 같습니다. 온라인에서 찾은 리소스는 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.