통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
랜덤 포레스트에 대해보고 할 훈련 오류는 무엇입니까?
현재 randomForestR 의 패키지를 사용하여 분류 문제에 임의의 포리스트를 적용하고 있으며 이러한 모델의 교육 오류 를보고하는 방법에 대해 잘 모르겠습니다 . 명령으로 얻은 예측을 사용하여 계산하면 내 훈련 오류가 0 %에 가깝습니다. predict(model, data=X_train) X_train훈련 데이터는 어디에 있습니까 ? 관련 질문에 대한 답변에서 , 나는 가방 부족 (OOB) 훈련 오류를 …

5
커널 SVM : 더 높은 차원의 피쳐 공간에 대한 매핑에 대한 직관적 인 이해와 이것이 선형 분리를 가능하게하는 방법을 원합니다.
커널 SVM의 직관을 이해하려고합니다. 이제 선형 SVM의 작동 방식을 이해하고 데이터를 최대한 분할하는 의사 결정 라인을 만듭니다. 또한 데이터를 더 높은 차원의 공간으로 포팅하는 원리와 이것이 새로운 공간에서 선형 의사 결정 라인을 더 쉽게 찾을 수있는 방법을 이해합니다. 내가 이해하지 못하는 것은 커널을 사용하여 데이터 포인트를이 새로운 공간에 투영하는 방법입니다. …

1
두 카운트의 차이의 중요성
시간 1의 교통 사고 수의 차이가 시간 2의 수와 크게 다른지 여부를 결정하는 방법이 있습니까? 서로 다른 시간에 관측 그룹 간의 차이를 결정하는 다른 방법을 찾았지만 (예 : 포아송 평균 비교) 두 카운트 만 비교할 수는 없습니다. 아니면 시도조차도 무효입니까? 조언이나 지시가 있으면 감사하겠습니다. 나는 후속 조치를 취하게되어 기쁘다.

1
가장 잘 맞는 라인이 있습니다. 가장 적합한 라인을 변경하지 않는 데이터 포인트가 필요합니다
피팅 라인에 대한 프레젠테이션을하고 있습니다. 간단한 선형 함수 와이= 1 x + b와이=1x+by=1x+b 있습니다. 내 선이 동일한 방정식에 가장 잘 맞는 분산 형 그림에 넣을 수있는 분산 된 데이터 포인트를 얻으려고합니다. 이 기술을 R 또는 Excel 중 더 쉬운 방법으로 배우고 싶습니다.


1
연구에서 검증 정확도는 높지만 테스트 정확도는 낮 으면 어떻게해야합니까?
기계 학습 연구의 유효성 검사에 대한 특정 질문이 있습니다. 아시다시피, 머신 러닝 체제는 연구원들에게 훈련 데이터에 대한 모델을 훈련시키고 검증 세트에 따라 후보 모델 중에서 선택하고 테스트 세트에 대한 정확성을보고하도록 요청합니다. 매우 엄격한 연구에서 테스트 세트는 한 번만 사용할 수 있습니다. 그러나 논문을 출판하거나 제출하기 전에 테스트 정확도가 최신 결과보다 …

3
스플라인 vs 가우시안 프로세스 회귀
가우시안 프로세스 회귀 (GPR)는 유연한 비선형 모델을 피팅하기 위해 스플라인을 사용하는 대신 사용할 수 있습니다. 어떤 상황에서 특히 베이지안 회귀 프레임 워크에서 어떤 상황이 다른 상황보다 더 적합한 지 알고 싶습니다. 이미 살펴 봤습니다 스플라인, 스무딩 스플라인 및 가우시안 프로세스 에뮬레이터의 장점과 단점은 무엇입니까? 그러나이 게시물에는 GPR에 아무것도없는 것 같습니다.


1
이후 분석을 수행하기 위해 PCA가 캡처 한 분산이 필요한가?
11 개의 변수가있는 데이터 세트가 있으며 데이터를 줄이기 위해 PCA (직교)가 수행되었습니다. 두 가지 주요 구성 요소 (PC)가 데이터를 설명하기에 충분하고 나머지 구성 요소는 정보가 충분하지 않다는 주제와 스 크리 플롯 (아래 참조)에 대한 내 지식을 유지하기 위해 구성 요소의 수를 결정하는 것이 분명했습니다. 병렬 분석을 사용한 스 크리 플롯 …
15 variance  pca 

1
CNN이 사라지는 그라디언트 문제를 피하는 방법
나는 convoloutional 신경 네트워크에 대해 많은 것을 읽었으며 그들이 사라지는 기울기 문제를 어떻게 피하는지 궁금해하고있었습니다. 나는 딥 신념 네트워크가 단일 레벨 자동 인코더 또는 다른 사전 훈련 된 얕은 네트워크를 쌓아서이 문제를 피할 수 있다는 것을 알고 있지만 CNN에서 어떻게 피할 수 있는지 모르겠습니다. Wikipedia 에 따르면 : "위에서 언급 …

4
컨볼 루션 신경망에 얼마나 많은 데이터가 필요합니까?
약 1,000,000 개의 매개 변수가있는 CNN (Convolutional Neural Network)을 사용하는 경우 얼마나 많은 훈련 데이터가 필요한지 (확률 적 경사 하강을 가정하고 있음)? 경험 법칙이 있습니까? 추가 사항 : 확률 적 그라디언트 디센트 (예 : 1 회 반복 64 패치)를 수행 할 때 ~ 10000 회 반복 후 분류기의 정확도는 대략 …

3
KNN을위한 최적의 K 선택
KNN을위한 최적의 K를 선택하기 위해 5 중 CV를 수행했습니다. 그리고 K가 클수록 오류가 작아지는 것처럼 보입니다 ... 죄송합니다. 범례가 없지만 색상이 다르면 시련이 다릅니다. 총 5 개가 있으며 그 사이에 약간의 차이가있는 것 같습니다. K가 커지면 오류는 항상 감소하는 것 같습니다. 그렇다면 최고의 K를 어떻게 선택할 수 있습니까? K = …

2
동일하지 않은 분산으로 t 검정에서 정수가 아닌 자유도에 대한 설명
SPSS t- 검정 절차 보고서는 2 개의 독립 평균을 비교할 때 2 개의 분석을 수행합니다. 하나의 분석은 동일한 분산을 가정하고 다른 분석은 동일한 분산을 가정하지 않았습니다. 등분 산을 가정 할 때 자유도 (df)는 항상 정수 값 (및 n-2)입니다. 등분 산이 가정되지 않을 때의 df는 정수가 아니며 (예 : 11.467) n-2 …

3
음이 아닌 행렬 분해에서 최적의 잠재 요인 수를 선택하는 방법은 무엇입니까?
매트릭스 주어 Vm×nVm×n\mathbf V^{m \times n} , 음수가 아닌 매트릭스 인수 분해 (NMF)는 두 개의 음수가 아닌 행렬 찾은 Wm×kWm×k\mathbf W^{m \times k} 및 Hk×nHk×n\mathbf H^{k \times n} (즉, 모든 요소 ≥0≥0\ge 0 )으로 분해 된 매트릭스를 나타내는 : V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, 예를 들어, 음이 아닌 WW\mathbf …

4
잠재 기능의 의미?
추천 시스템의 매트릭스 인수 분해 모델을 이해하려고 노력하고 있으며 항상 '잠재적 기능'을 읽습니다. 그러나 그 의미는 무엇입니까? 기능이 교육 데이터 세트에 어떤 의미가 있는지 알고 있지만 잠재 기능에 대한 아이디어를 이해할 수 없습니다. 내가 찾을 수있는 주제에 대한 모든 문서는 너무 얕습니다. 편집하다: 적어도 아이디어를 설명하는 논문을 알려 주시면됩니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.