통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


2
양의 상관 관계 및 음의 회귀 계수 표시
회귀 분석과 반응 ( +0,43) 사이에 양의 상관 관계를 얻을 수 있으며, 그 후에이 회귀 분석기의 적합 회귀 모형에서 음의 계수를 얻을 수 있습니까? 일부 모델에서 회귀 기호의 변화에 ​​대해 이야기하고 있지 않습니다. 계수 부호는 항상 유지됩니다. 적합 모형의 나머지 변수가 부호 변경에 영향을 줄 수 있습니까?

1
기록 된 변수를 사용하는 이유는 무엇입니까?
아마도 이것은 매우 기본적인 질문이지만 확실한 대답을 찾지 못하는 것 같습니다. 나는 여기서 할 수 있기를 바랍니다. 나는 현재 자신의 석사 논문 준비를 위해 논문을 읽고 있습니다. 현재 트윗과 주식 시장 기능의 관계를 조사하는 논문을 읽고 있습니다. 그들의 가설 중 하나에서, 그들은 증가 된 트위터 양이 거래량 증가와 관련이 있다고 …


3
결 측값이있는 행렬의 SVD
Netflix 스타일 권장 매트릭스가 있고 특정 사용자의 향후 영화 등급을 예측하는 모델을 만들고 싶다고 가정합니다. Simon Funk의 접근 방식을 사용하면 확률 적 그라디언트 디센트를 사용하여 전체 행렬과 항목 별 * 사용자 별 행렬 사이의 Frobenius 표준을 최소화하여 L2 정규화 항을 사용합니다. 실제로 사람들은 추천 매트릭스의 결 측값으로 무엇을합니까? 계산의 요점은 …

5
Bayesians는 그들의 접근 방식이 잦은 접근 방식으로 일반화 / 중복되는 경우가 있다고 주장 하는가?
Bayesians는 그들의 접근 방식이 잦은 접근 방식을 일반화한다고 주장합니까? 비 정보적인 선행을 사용할 수 있기 때문에 전형적인 잦은 모델 구조를 회복 할 수 있습니까? 이 논쟁이 실제로 사용된다면 내가 읽을 수있는 곳을 누구든지 언급 할 수 있습니까? 편집 :이 질문은 내가 그것을 표현하는 방식과 정확히 일치하지 않을 수 있습니다. 문제는 …

2
PCA 및 임의 포리스트
최근의 Kaggle 경쟁을 위해, 나는 (수동으로) 내 훈련 세트에 대해 10 개의 추가 기능을 정의했으며,이 기능은 임의의 숲 분류기를 훈련시키는 데 사용됩니다. 새로운 기능으로 데이터 세트에서 PCA를 실행하여 서로 비교하는 방법을 확인하기로 결정했습니다. 분산의 ~ 98 %가 첫 번째 성분 (첫 번째 고유 벡터)에 의해 전달됨을 발견했습니다. 그런 다음 분류기를 …

2
구조물의 독립성을 결정하는 탐색 적 및 확인 적 요인 분석의 차이점
연구자들은 종종 매우 유사한 항목을 가진 두 가지 척도를 사용하고 서로 다른 것을 측정한다고 주장합니다 (예 : "저는 자동차를 둘러 볼 때 항상 걱정합니다"; "자동차가 두렵습니다"). 자동차 척도에 대한 자동차의 두려움 측정 및 불안에 대한 가상의 측정을 호출 할 수 있습니다. 그들이 실제로 다른 잠재 구조를 평가하거나 동일한 것을 측정하는 …

2
요인 분석, 내부 일관성 및 항목 반응 이론을 함께 사용하여 항목 수를 줄이는 방법은 무엇입니까?
나는 경험적으로 설문지를 개발하는 과정에 있으며이 예에서는 임의의 숫자를 사용하여 설명 할 것입니다. 문맥 상, 나는 불안 장애가있는 개인들에게서 일반적으로 확인되는 사고 패턴을 평가하는 것을 목표로하는 심리적 설문지를 개발하고 있습니다. 항목이 " 오븐이 꺼져 있는지 확인할 수 없기 때문에 오븐을 반복해서 확인해야합니다 "처럼 보일 수 있습니다 . 하나 또는 두 …

4
비정규 데이터와 비정규 데이터로 Z 점수를 사용할 수 있습니까? [닫은]
폐쇄되었습니다 . 이 질문에는 세부 사항이나 명확성 이 필요 합니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 이 게시물 을 편집 하여 세부 사항을 추가하고 문제점을 명확하게하십시오 . 휴일 오년 전에 . 전체 사이클 시간의 일부를 비교하기 위해 일부 프로세스 사이클 시간 데이터 및 표준 z- 스코어를 사용한 스케일링 …

1
편향 보정이란 무엇입니까? [닫은]
폐쇄되었습니다 . 이 질문에는 세부 사항이나 명확성 이 필요 합니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 이 게시물 을 편집 하여 세부 사항을 추가하고 문제점을 명확하게하십시오 . 휴일 3 년 전 . 나는 입 / 출력 데이터 세트가있는 곳을 처음 보았습니다. 처음에는 선형 회귀 선을 만들고 바이어스를 수정 …


1
여러 예측 변수가있는 로짓 모형에 대한 확률 곡선 그래프
다음과 같은 확률 함수가 있습니다. Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} 어디 z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. 내 모델은 다음과 같습니다 Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid})]\right)} 이것은 아래와 같은 확률 곡선을 통해 시각화됩니다. 원래 회귀 방정식에 몇 가지 변수를 추가하는 것을 고려하고 있습니다. 모델에 성별 …

2
로지스틱 회귀 잔차 분석
이 질문은 일반적이고 오래 걸리는 것이지만 나와 함께 견뎌주십시오. 내 응용 프로그램에는 ~ 50 개의 기능과 단일 종속 이진 변수가있는 ~ 20,000 개의 데이터 포인트로 구성된 많은 데이터 세트가 있습니다. 정규화 된 로지스틱 회귀를 사용하여 데이터 세트를 모델링하려고합니다 (R 패키지 glmnet ) 분석의 일부로 다음과 같이 잔차 그림을 만들었습니다. 각 …

1
복잡한 모델을 대규모 데이터 세트에 반복적으로 피팅 할 때 계산 효율성을 어떻게 최적화 할 수 있습니까?
MCMCglmm혼합 효과 모델을 실행하기 위해 R 의 패키지를 사용하는 성능 문제가 있습니다. 코드는 다음과 같습니다. MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) 데이터에는 약 20,000 개의 관측치가 있으며 약 200 개의 학교에 모여 있습니다. 실행하기 전에 데이터 프레임에서 사용하지 않는 모든 변수를 삭제하고 메모리에서 다른 모든 개체를 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.