통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
협업 필터링의 최신 기술
CF (collaborative filtering)를위한 프로젝트, 즉 부분적으로 관찰 된 매트릭스 또는보다 일반적으로 텐서를 완성하는 중입니다. 나는이 분야의 초보자이며,이 프로젝트를 위해 우리의 방법을 요즘 제안 된 방법, 즉 CF의 최신 기술과 비교하는 다른 잘 알려진 방법과 비교해야합니다. 내 검색에서 다음 방법이 밝혀졌습니다. 실제로 나는이 논문들과 참고 문헌을 보거나 그들이 비교할 때 실험 …

3
회귀 모형의 정의 및 구분
당황스럽게도 간단한 질문이지만 Cross Validated에서 이전에 요청되지 않은 것 같습니다. 회귀 모델의 정의는 무엇입니까? 또한 지원 질문 무엇 되지 회귀 모델은? 후자와 관련하여 ARIMA 또는 GARCH와 같은 대답이 즉시 명확하지 않은 까다로운 예제에 관심이 있습니다.

3
선형 회귀 : OLS와 MLE을 식별하는 비정규 분포가 있습니까?
이 질문은 주석의 오랜 토론에서 영감을 얻었습니다. 선형 회귀는 정규 분포를 어떻게 사용합니까? 일반적인 선형 회귀 모델에서, 단순화를 위해 여기에서 하나의 예측 작성 : Yi=β0+β1xi+ϵiYi=β0+β1xi+ϵi Y_i = \beta_0 + \beta_1 x_i + \epsilon_i 를 Where xixix_i 상수를 공지되어 ϵiϵi\epsilon_i 제로 평균 독립 에러 조건이다. 또한 오차에 대한 정규 분포를 가정하면, …

1
이것은 어떤 종류의 차트입니까?
모호한 질문에 대해 죄송하지만이 차트는 Biddle et al. 2009 년 에 나는 이전과 비슷한 것을 경험하지 못했습니다. 경 사진 모서리가있는 막대 차트이며 때로는 '뿔'입니다. 이것들은 무엇을 의미합니까? 이 유형의 차트에 이름이 있습니까? 당 /meta/244083/site-for-asking-about-charts 나는 학자가 요구하는 가장 좋은 장소라고 생각했다.

3
더미 변수 센터링 및 스케일링
범주 형 변수와 연속 변수가 모두 포함 된 데이터 세트가 있습니다. 범주 형 변수를 각 수준에 대한 이진 변수로 변환하는 것이 좋습니다 (예 : A_level1 : {0,1}, A_level2 : {0,1}). 일부는이 "더미 변수"라고합니다. 그렇게 말하면, 새로운 변수로 전체 데이터 세트를 중앙에 배치하고 스케일링하는 것이 오해의 소지가 있습니까? 마치 변수의 "켜기 …

7
결과를 "거의"또는 "약간"중요하다고 말하는 것이 잘못입니까?
비슷한 질문에 대한 일반적인 합의 : 결과를 "매우 중요"하다고 말하는 것이 잘못 되었습니까? "매우 중요"는 비 특정 적이지만 p- 값이 사전 설정된 유의성 임계 값보다 훨씬 낮은 연관의 강도를 설명하는 유효한 방법입니다. 그러나 임계 값 보다 약간 높은 p- 값을 설명하는 것은 어떻습니까? 나는 몇몇 논문이 "약간 중요하다", "거의 중요하다", …

1
감독 차원 축소
15K 레이블이 지정된 샘플 (10 그룹)로 구성된 데이터 세트가 있습니다. 레이블의 지식을 고려하여 차원 축소를 2 차원으로 적용하고 싶습니다. PCA와 같은 "표준"감독되지 않은 차원 축소 기법을 사용할 때 산점도는 알려진 레이블과 관련이없는 것 같습니다. 찾고있는 이름이 있습니까? 솔루션에 대한 몇 가지 참조를 읽고 싶습니다.

1
PCA가 항상 좌표축을 회전시키는 경우 "회전 된"및 "회전되지 않은"주요 구성 요소는 무엇입니까?
내가 이해하는 한, 주요 구성 요소는 좌표축을 회전하여 최대 분산 방향에 정렬하여 얻습니다. 그럼에도 불구하고, 나는 "회전하지 않은 주성분"에 대해 계속 읽고 있으며, 통계 소프트웨어 (SAS)는 회전하지 않은 주성분뿐만 아니라 varimax로 회전 된 주성분을 제공합니다. 여기서 혼란스러워합니다. 주성분을 계산할 때 축이 이미 회전되어 있습니다. 그렇다면 또 다른 회전이 필요한 이유는 …

1
딥 네트워크의 LSTM 계층을 훈련시키는 방법
텍스트를 분류하기 위해 lstm 및 피드 포워드 네트워크를 사용하고 있습니다. 텍스트를 one-hot 벡터로 변환하고 각각을 lstm에 공급하여 단일 표현으로 요약 할 수 있습니다. 그런 다음 다른 네트워크에 공급합니다. 그러나 lstm을 어떻게 훈련합니까? 텍스트를 순서대로 분류하고 싶습니다. 훈련없이 텍스트를 제공해야합니까? 나는 구절을 분류기의 입력 레이어에 공급할 수있는 단일 항목으로 표현하고 싶습니다. …

3
컨볼 루션 신경망은 행렬 곱셈 대신 컨볼 루션을 정확히 어떻게 사용합니까?
딥 러닝 에 관한 Yoshua Bengio의 책을 읽고 있었고 224 페이지에 나와 있습니다. 컨볼 루션 네트워크는 레이어 중 하나 이상에서 일반 행렬 곱셈 대신 컨볼 루션을 사용하는 신경망입니다. 그러나 수학적으로 정확한 의미에서 "콘볼 루션으로 행렬 곱셈을 대체하는"방법을 100 % 확신하지 못했습니다. 내가 정말로 관심있는 것은 1D의 입력 벡터 ( 와 …

5
거리 (유클리드)를 유사성 점수로 변환하는 방법
사용하여 스피커 음성을 클러스터링한다는 의미입니다. 발화를 클러스터 된 스피커 데이터와 비교하면 (유클리드 거리 기반) 평균 왜곡이 발생합니다. 이 거리는 범위에있을 수 있습니다 . 이 거리를 유사성 점수 로 변환하고 싶습니다 . 내가 어떻게 이것을 달성 할 수 있는지 안내해주세요.kkk[0,∞][0,∞][0,\infty][ 0 , 1 ][0,1][0,1]

1
부분 F- 통계량이란 무엇입니까?
부분 F- 통계량이란 무엇입니까? 부분 F- 검정과 동일합니까? 부분 F- 통계량은 언제 계산합니까? 나는 이것이 회귀 모델을 비교하는 것과 관련이 있다고 가정하고 있지만, 나는 무언가를 따르지 않습니다 (?)

1
스트라타와 스트라타 공변량 상호 작용을 갖는 Cox 모델 피팅은 두 Cox 모델 피팅과 다른가?
에서는 회귀 모형 전략 하렐 (2 판)에 의해 단면 (S. 20.1.7)의 주요 효과 생존에서 우리는 (아래 예에서 세)과 추정 할 공변량 사이의 상호 작용을 포함 콕스 모델을 논의하고있다 주요 효과를 추정하지 않으려는 공변량 (아래 예의 성별). 구체적으로 : 모집단에서 (알 수없는, 참된) 위험 가 모형 을 따른다고 가정합니다h ( 톤 …

1
장기 분산이란 무엇입니까?
시계열 분석 영역에서 장기 분산은 어떻게 정의됩니까? 데이터에 상관 관계 구조가있는 경우에 사용된다는 것을 알고 있습니다. 따라서 확률 론적 과정은 iid 임의 변수가 아니라 동일하게 분포 된 것입니까?X1,X2…X1,X2…X_1, X_2 \dots 개념에 대한 소개 및 추정과 관련된 어려움으로 표준 참조를 할 수 있습니까?

3
랜덤 포레스트 및 부스팅 파라 메트릭 또는 비 파라 메트릭입니까?
탁월한 통계 모델링 을 읽음으로써 두 문화 (Breiman 2001) 는 전통적인 통계 모델 (예 : 선형 회귀)과 기계 학습 알고리즘 (예 : 배깅, 랜덤 포레스트, 부스트 트리 ...)의 모든 차이점을 파악할 수 있습니다. Breiman은 데이터 모델 (모수)이 통계를 통해 알려진 자연스럽고 모방 된 공식 모델에 의해 관측이 생성된다는 가정에 근거하기 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.