통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
중앙값이 같을 때 Mann-Whitney U 검정이 중요한 이유는 무엇입니까?
이해할 수없는 Mann-Whitney 등급 테스트 결과를 받았습니다. 두 모집단의 중앙값은 동일합니다 (6.9). 각 모집단의 uppper와 lower Quantile은 다음과 같습니다. 6.64 및 7.2 6.60 및 7.1 이 모집단을 비교 한 검정의 결과 p- 값은 0.007입니다. 이 인구는 어떻게 크게 다를 수 있습니까? 중앙값이 확산 되었기 때문입니까? 2를 비교하는 상자 그림은 두 …


1
포인트 프로세스 간 교차 상관 분석
통계적으로 바람직한 지 확인하기 위해 사용중인 분석 방법에 대한 조언을 원합니다. 나는 두 점 프로세스 과 T 2 = t (2) (1) , t (2) 2 , . . . , t 2 m 그리고 T 1 의 이벤트 가 어떻게 든 T 2 의 이벤트와 상관 되는지 확인하려고합니다 .T1=t11,t12,...,t1nT1=t11,t21,...,tn1T^1 …


1
연결주의 시간 분류 (CTC) 란 무엇입니까?
광학 문자 인식 (OCR) 프로젝트를 수행하려고합니다. 몇 가지 연구를 한 후에 흥미로운 것으로 보이는 아키텍처 인 CNN + RNN + CTC를 발견했습니다. CNN (Convoluted Neural Network) 및 RNN (Recurrent Neural Network)에 익숙하지만 CTC (Connectionistor Temporal Classification) 란 무엇입니까? 평신도의 용어로 설명하고 싶습니다.

2
KNN에서 데이터를 확장해야하는 이유
가장 가까운 이웃 K 개를 사용할 때 왜 데이터를 정규화해야하는지 설명해 주시겠습니까? 나는 이것을 찾으려고 노력했지만 여전히 그것을 이해할 수없는 것 같습니다. 다음 링크를 찾았습니다. https://discuss.analyticsvidhya.com/t/why-it-is-necessary-to-normalize-in-knn/2715 그러나이 설명에서 기능 중 하나의 더 큰 범위가 예측에 영향을 미치는 이유를 이해하지 못합니다.

3
부풀려진 분포가 없는데 실제로 무엇입니까?
제로 팽창 분포를 이해하기 위해 고심하고 있습니다. 그들은 무엇인가? 점은 무엇인가? 0이 많은 데이터가있는 경우 로지스틱 회귀에 적합하고 먼저 0의 확률을 계산 한 다음 모든 0을 제거한 다음 선택한 분포 (예 : 포아송)를 사용하여 정기적 회귀에 적합합니다. 그런 다음 누군가 나에게 "이봐, 제로 팽창 분포를 사용하십시오."라고 말했지만 그것을 찾으면 위에서 …

6
신경망을 훈련하면서 왜 데이터를 섞어 야합니까?
신경망의 미니 배치 훈련에서, 중요한 관행은 모든 시대 이전에 훈련 데이터를 섞는 것입니다. 각 시대의 셔플 링이 도움이되는 이유를 누군가가 설명 할 수 있습니까? Google 검색에서 다음 답변을 찾았습니다. 훈련이 빠르게 수렴하는 데 도움이됩니다. 훈련 중 편견을 방지합니다 모델이 훈련 순서를 배우지 못하게합니다. 그러나 임의의 셔플 링으로 인해 이러한 효과가 …


1
딥 러닝 용 Adam 최적화 프로그램에 바이어스 보정 용어를 포함시키는 것이 중요한 이유는 무엇입니까?
저는 Deep Learning 의 Adam 최적화 프로그램에 대해 읽었으며 Begnio, Goodfellow 및 Courtville 의 새 책 Deep Learning 에서 다음 문장을 보았습니다. Adam은 원점에서의 초기화를 설명하기 위해 1 차 모멘트 (모멘텀 항) 및 (비 중심) 2 차 모멘트의 추정치에 대한 바이어스 보정을 포함합니다. 이러한 바이어스 보정 항을 포함하는 주된 이유는 …

2
"F 회귀"및
피쳐를 F-regression레이블과 개별적으로 상관시키고 값을 관찰하는 것과 동일한 피쳐를 사용하여 피쳐를 비교 합니까?R2R2R^2 나는 종종 동료 F regression들이 다음의 머신 러닝 파이프 라인에서 기능 선택을 위해 사용하는 것을 보았습니다 sklearn. sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` 일부는 말해주십시오-왜 레이블 / 종속 변수와 상관 관계가있는 것과 동일한 결과를 제공합니까? F_regression기능 선택에서 사용하는 이점이 명확하지 않습니다 . …

1
차원 저주가 일부 모델보다 다른 모델에 영향을 줍니까?
치수 저주에 대해 읽은 장소는 주로 kNN 및 선형 모델과 관련하여 설명합니다. 나는 100k 데이터 포인트가 거의없는 데이터 세트의 수천 가지 기능을 사용하여 Kaggle에서 최고 순위를 정기적으로 봅니다. 그들은 주로 Boosted tree와 NN을 사용합니다. 많은 기능이 너무 높아 보이며 차원 저주의 영향을받는다고 생각합니다. 그러나 이러한 모델이 경쟁에서 최고가 되었기 때문에 …

1
VC 차원은 딥 러닝에 대해 무엇을 알려줍니까?
기본 기계 학습에서는 다음과 같은 "엄지 손가락 규칙"을 배웁니다. a) 데이터의 크기는 가설 세트의 VC 차원 크기의 10 배 이상이어야합니다. b) N 개의 연결을 갖는 신경망은 약 N의 VC 치수를 갖는다. 따라서 딥 러닝 신경망이 수백만 단위라고 말하면 이것이 수십억 개의 데이터 포인트를 가져야한다는 의미입니까? 이것에 대해 좀 밝힐 수 …

2
lrtest ()가 anova (test =“LRT”)와 일치하지 않는 이유
모형 적합을 비교하기 위해 R에서 우도 비 검정을 수행하는 방법을 찾고있었습니다. 내가 먼저 나 자신을 코딩, 디폴트 모두 발견 anova()기능도 lrtest()에 lmtest패키지로 제공된다. 그러나 검사 할 때 anova()'test'매개 변수가 "LRT"로 설정되어 있어도 항상 다른 두 값과 약간 다른 p- 값이 생성됩니다. anova()실제로 미묘하게 다른 테스트를 수행하고 있습니까 , 아니면 무언가를 …

1
glmnet 로지스틱 회귀 분석은 더미 변수없이 요인 (범주) 변수를 직접 처리 할 수 ​​있습니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 삼년 전에 . 나는 기능 LASSO 방법을 사용하여 R에 로지스틱 회귀 분석을 짓고 있어요 cv.glmnet을 선택 lambda하고 glmnet최종 모델. 자동 모델 선택과 관련된 모든 단점을 이미 알고 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.