통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
mgcv GAM 모델에서 스무딩 조정 방법
mgcv : gam 모델에서 스무딩 매개 변수를 제어하는 ​​방법을 알아 내려고합니다. 고정 그리드에서 주로 x 및 y 좌표의 함수로 모델링하려는 이항 변수가 있으며 더 작은 영향을 미치는 다른 변수도 있습니다. 과거에는 패키지 위치 지정과 (x, y) 값을 사용하여 합리적으로 좋은 로컬 회귀 모델을 만들었습니다. 그러나 다른 변수를 모델에 통합하려고 시도하고 …
14 r  smoothing  mgcv 

3
클러스터링에 대한
누구나 L 2 대신 L1L1L_1 또는 L.5L.5L_.5 메트릭을 클러스터링에 사용 합니까? Aggarwal et al., 고차원 공간에서의 거리 측정법의 놀라운 행동에 대해 (2001 년)L2L2L_2 높은 차원의 데이터 마이닝 응용 프로그램에 대해L1L1L_1유클리드 거리 측정법 보다 L 1 이 지속적으로 더 바람직 L2L2L_2합니다. 또는 이 아직 더 수 있다고 주장했습니다 .L.5L.5L_.5L.1L.1L_.1 또는 를 …

5
어린이 통계 나 확률을 가르치는 소프트웨어 (또는 웹앱)?
(먼 미래에) 아이들에게 통계를 가르치고 싶습니다. 그 문제에 대해, 나는 아이들 (또는 그 문제에 대한 성인)에게 통계 / 확률 론적 아이디어를 설명하는 데 도움이되는 소프트웨어 (물론 FOSS를 향한 경향이 있음) 또는 웹 응용 프로그램을 알게되어 기쁩니다. 이것은 강사, 어린이 또는 둘 모두가 사용할 수 있습니다. 제안 된 답변 형식 : …


2
문구의 직관적 인 설명
나는 잠시 동안 고개를 곤두 세우면서 씨름하고 있었다 ... 어떻게 생각 하는가? 의견이나 추가 의견이 있으시면 감사하겠습니다. 고정 프로세스는 분포 평균과 분산이 일정하게 유지되도록 시계열 값을 생성하는 프로세스입니다. 엄밀히 말하면, 이것은 약한 형태의 정상 성 또는 공분산 / 평균 성 정상 성으로 알려져 있습니다. 약성의 형태는 시계열이 시간에 걸쳐 일정한 …

3
부분 상관이 0 차 상관보다 큰 것이 합리적입니까?
이것은 부분 상관 관계가 어떻게 작동하는지에 대한 이해가 근본적으로 부족하다는 것을 보여줍니다. x, y, z라는 3 개의 변수가 있습니다. z를 제어하면 z가 제어되지 않은 경우 x와 y의 상관 관계가 x와 y의 상관 관계보다 증가합니다. 이게 말이 돼? 나는 세 번째 변수의 효과를 제어 할 때 상관 관계가 감소해야한다고 생각하는 경향이 …


7
짧은 시계열이 모델링 가치가 있습니까?
여기 몇 가지 맥락이 있습니다. 두 가지 환경 변수 (온도, 영양소 수준)가 11 년 동안 반응 변수의 평균 값에 어떤 영향을 미치는지 결정하고 싶습니다. 매년 1 억 개가 넘는 위치의 데이터가 있습니다. 목표는 11 년 동안 반응 변수의 평균값이 환경 변수의 변화에 ​​반응했는지 여부를 결정하는 것입니다 (예 : 더 따뜻한 …

1
언제 AdaBoost를 사용하고 싶습니까?
직장에서 반복적으로 언급 된 AdaBoost 분류기에 대해 들었을 때, 작동 방식과 사용시기에 대해 더 나은 느낌을 얻고 싶었습니다. 계속해서 Google에서 찾은 여러 논문과 자습서를 읽었지만 여전히 이해하기 어려운 분류 기준이 있습니다. 내가 본 대부분의 튜토리얼은 AdaBoost에 대해 많은 분류기 중 가장 가중치가 높은 조합을 찾는 것으로 말합니다. 이것은 나에게 의미가 …

1
불일치 시퀀스가 ​​낮은 스크램블링 및 상관 관계 (Halton / Sobol)
현재 Halton 및 Sobol 포인트 세트와 같이 낮은 불일치 / 준 랜덤 포인트 세트를 사용하여 임의의 값을 생성하는 프로젝트를 진행 하고 있습니다. 이들은 본질적 차원 벡터 것을 모방 D 차원 균일 (0) 변수가 있지만, 더 확산을 갖는다. 이론적으로 그들은 프로젝트의 다른 부분에서 내 추정치의 분산을 줄이는 데 도움이됩니다.ddddddd 불행히도, 나는 …

4
종속 변수가 다른 모델의 로지스틱 계수 비교
이것은 내가 며칠 전에 물었던 후속 질문입니다 . 나는 그것이 그 문제에 대해 다른 기울기를두고 있다고 생각하므로 새로운 질문을 나열했다. 문제는 모델마다 계수의 크기를 다른 종속 변수와 비교할 수 있습니까? 예를 들어, 한 표본에서 경제가 하원 의원 또는 대통령에 대한 더 강력한 투표 예측기인지 알고 싶다고 말합니다. 이 경우 내 …

2
순서 또는 명목 데이터에서 범주를 병합 / 축소하는 방법은 무엇입니까?
명목 또는 서수 데이터에서 범주 수를 줄이는 방법을 찾기 위해 고심하고 있습니다. 예를 들어, 여러 명목 및 순서 요인이있는 데이터 집합에 회귀 모델을 작성한다고 가정 해 보겠습니다. 이 단계에는 아무런 문제가 없지만, 종종 공칭 기능이 훈련 세트에서 관찰되지 않지만 유효성 검사 데이터 세트에 존재하는 상황이 자주 발생합니다. 이로 인해 모델에 …

6
식별자로 그룹화 된 데이터 프레임의 첫 번째 행을 얻는 빠른 방법 R
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 2 년 전 . 때때로 개인별로 여러 개의 관측치가있을 때 연령과 성별을 검색 할 때와 같이 식별자로 그룹화 된 데이터 세트의 첫 번째 행만 가져와야합니다. R 에서이 …
14 r  dataset  aggregation  plyr 

3
두 개의 히스토그램을 같은 규모로 배치하는 가장 좋은 방법은 무엇입니까?
모양, 크기 및 이동을 쉽게 볼 수있는 방식으로 자세하게 비교하고자하는 두 개의 분포가 있다고 가정 해 봅시다. 이를 수행하는 한 가지 좋은 방법은 각 분포에 대한 히스토그램을 플로팅하여 동일한 X 스케일에 배치하고 다른 하나 아래에 쌓이는 것입니다. 이 작업을 수행 할 때 비닝을 어떻게 수행해야합니까? 아래 그림 1에서와 같이 하나의 …

3
볼츠만 머신에서 학습 가중치
Boltzmann 기계가 어떻게 작동하는지 이해하려고 노력하고 있지만 무게가 어떻게 학습되는지 확실하지 않으며 명확한 설명을 찾을 수 없었습니다. 다음이 맞습니까? (또한 좋은 Boltzmann 기계 설명에 대한 포인터도 좋습니다.) 우리는 가시적 인 단위 (예를 들어, 이미지의 흑백 픽셀에 해당)와 숨겨진 단위의 세트를 가지고 있습니다. 가중치는 어떻게 든 초기화되고 (예 : [-0.5, 0.5]에서 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.