통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


5
최소 클러스터 크기 제한이있는 클러스터링 (k- 평균 또는 기타)
그룹 내 제곱합 (WSS)을 최소화하기 위해 장치를 클러스터로 클러스터링해야하지만 클러스터에 적어도 단위가 포함되도록해야합니다 . R의 군집 기능 중 최소 군집 크기 제약 조건이 적용 되는 군집으로 군집 할 수있는 아이디어가 있습니까? kmeans ()는 크기 제한 옵션을 제공하지 않는 것 같습니다.m kkkkmmmkkk
14 r  clustering 

2
R에서 coxph의 "coef"와 "(exp) coef"출력의 차이점은 무엇입니까?
나는 coxph의 "coef"와 "(exp) coef"출력이 정확히 무엇을 의미하는지 알아 내려고 노력했습니다. "(exp) coef"는 명령에 지정된 그룹에 따라 모델의 첫 번째 변수를 비교 한 것으로 보입니다. coxph 함수는 "coef"및 "(exp) coef"의 값에 어떻게 도달합니까? 또한, 검열이 수반 될 때 coxph는 이러한 값을 어떻게 결정합니까?

3
OLS는 파란색입니다. 그러나 편견과 선형성에 관심이 없다면 어떻게해야합니까?
Gauss-Markov 정리는 OLS 추정기가 선형 회귀 모형에 가장 적합한 선형 비 편향 추정기라고 알려줍니다. 그러나 선형성과 편견에 신경 쓰지 않는다고 가정하십시오. 그런 다음 Gauss-Markov 가정 또는 다른 일반적인 가정 세트에서 가장 효율적인 선형 회귀 모델에 대한 다른 (비선형 / 바이어스 가능) 추정기가 있습니까? 물론 하나의 표준 결과가 있습니다. OLS 자체는 …


5
대체 가설이 필요한 이유는 무엇입니까?
테스트 할 때 두 가지 결과가 나옵니다. 1) 귀무 가설을 기각한다 2) 귀무 가설을 기각하지 않습니다. 우리는 다른 가설을 받아들이는 것에 대해 이야기하지 않습니다. 대립 가설 수용에 대해 이야기하지 않으면 왜 대립 가설이 필요합니까? 여기에 업데이트가 있습니다 : 누군가 나에게 두 가지 예를 줄 수 있습니까? 1) 귀무 가설을 기각하는 …

2
감마 분포 로그의 예상 값은 얼마입니까?
의 예상 값 이 인 경우 의 예상 값은 입니까 ? 분석적으로 계산할 수 있습니까?G a m m a (α,β)지ㅏ미디엄미디엄ㅏ(α,β)\mathsf{Gamma}(\alpha, \beta)αβαβ\frac{\alpha}{\beta}로그( G a m m a ( α , β) )로그⁡(지ㅏ미디엄미디엄ㅏ(α,β))\log(\mathsf{Gamma}(\alpha, \beta)) 내가 사용하는 매개 변수는 모양 속도입니다.

3
신경망에 기능 선택 / 엔지니어링이 필요한 이유는 무엇입니까?
특히 kaggle 경쟁과 관련하여 모델의 성능이 기능 선택 / 엔지니어링에 관한 것임을 알았습니다. 더 전통적인 / 구식 ML 알고리즘을 처리 할 때 그 이유가 무엇인지 완전히 이해할 수는 있지만 심층 신경망을 사용할 때 왜 그런지 알 수 없습니다. 딥 러닝 책 인용 : 딥 러닝은 다른 더 단순한 표현으로 표현되는 …

2
베타 회귀 분석에서 로짓 링크를 사용하는 이유는 무엇입니까?
최근에 저는 베타 회귀 모델을 구현하는 데 관심이있었습니다. 이 결과에는 이산적인 "성공"이라는 의미있는 개념이 없기 때문에이 결과는 이항 적 맥락에 맞지 않을 것입니다. 실제로 결과는 실제로 기간의 비율입니다. 분자는 초 수이며 특정 조건은 조건이 활성화 될 수있는 총 시간 (초) 동안 활성화됩니다. 나는 vagaries에 대해 사과하지만이 정확한 맥락에 너무 집중하고 …

1
신경망에서 병목 현상 계층이란 무엇입니까?
나는 FaceNet 논문 을 읽고 있었고 소개의 세 번째 단락에서 다음과 같이 말합니다. 딥 네트워크를 기반으로 한 이전의 얼굴 인식 방법은 알려진 얼굴 ID 집합에 대해 훈련 된 분류 계층을 사용한 다음 훈련에 사용 된 ID 집합 이상의 인식을 일반화하는 데 사용되는 표현으로 중간 병목 층을 사용합니다. 중간 병목 현상 …

3
기계 학습 파이프 라인에서 기능 선택 및 하이퍼 파라미터 최적화를 어떻게 주문해야합니까?
내 목표는 센서 신호를 분류하는 것입니다. 지금까지 내 솔루션의 개념은 다음과 같습니다. i) 원시 신호에서 엔지니어링 기능 ii) ReliefF 및 클러스터링 방식으로 관련 기능 선택 iii) NN, 랜덤 포레스트 및 SVM 적용 그러나 나는 딜레마에 갇혀있다. ii) 및 iii)에는 ReliefF의 k-Nearest Neigbours 또는 센서 신호가 평가되는 창 길이 또는 NN의 …

1
딥 Q 학습에서 에피소드와 에포크의 차이점은 무엇입니까?
나는 유명한 논문 "심층 강화 학습으로 아타리 연주"( pdf ) 를 이해하려고합니다 . 신기원 과 에피소드 의 차이점에 대해 잘 모르겠습니다 . 알고리즘 에서 외부 루프는 에피소드 위에 있으며 그림 에서 x 축은 epoch 로 표시 됩니다. 강화 학습의 맥락에서, 나는 신기원이 무엇을 의미하는지 명확하지 않습니다. 에피소드 루프 주변의 시대는 …

2
k- 폴드 교차 검증은 훈련 / 검증 / 테스트 세트의 맥락에 어떻게 적합합니까?
나의 주요 질문은 k- 폴드 교차 검증이 훈련 / 검증 / 테스트 세트를 갖는 맥락에서 어떻게 맞는지 이해하려고 노력하는 것과 관련이 있습니다 (그러한 맥락에서 전혀 적합하다면). 일반적으로 사람들은 데이터를 훈련, 검증 및 테스트 세트 (앤드류 응 코스 당 60/20/20의 비율)로 분할하여 검증 세트가 모델 훈련을위한 최적의 파라미터를 식별하는 데 사용된다고 …

2
Naive Bayes는 연속 변수와 어떻게 작동합니까?
내 (매우 기본적인) 이해를 위해 Naive Bayes는 훈련 데이터에서 각 기능의 클래스 빈도를 기반으로 확률을 추정합니다. 그러나 연속 변수의 빈도를 어떻게 계산합니까? 그리고 예측을 수행 할 때 훈련 세트에서 동일한 관측치 값을 가질 수없는 새로운 관측치를 어떻게 분류합니까? 거리 측정을 사용하거나 1NN을 찾습니까?

1
1 %와 같은 낮은 이벤트 속도의 데이터에 그라디언트 부스팅이 적합합니까?
Enterprise miner를 사용하여 이벤트 속도가 약 1 % 인 데이터 세트에서 그라디언트 향상을 시도하고 있지만 출력을 생성하지 못했습니다. 내 질문은 의사 결정 트리 기반의 접근 방식이므로 그러한 낮은 이벤트에서 그라디언트 부스팅을 사용하는 것이 옳습니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.