통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


2
어떤 시점에서 응답이 심하게 왜곡되고 일부는 반복 측정 연구에 있지 않은 경우 어떻게해야합니까?
일반적으로 종단 설계에서 연속적이지만 치우친 결과 측정치가 발생하는 경우 (예 : 개체 간 효과가 하나 인 경우) 일반적인 접근 방식은 결과를 정규성으로 변환하는 것입니다. 절단 된 관측과 같이 상황이 극단적 인 경우에는 환상적이게되고 Tobit 성장 곡선 모델 또는 일부를 사용할 수 있습니다. 그러나 특정 시점에 일반적으로 분배 된 결과가 다른 …

2
LARS의 올가미 수정
Lasso를 생성하기 위해 Lars 알고리즘을 수정하는 방법을 이해하려고합니다. LARS를 이해하는 동안 Tibshirani 등의 논문에서 Lasso 수정을 볼 수 없습니다. 특히 0이 아닌 좌표의 부호가 현재 상관 관계의 부호와 일치 해야하는 부호 조건을 왜 알지 못합니다. 누군가 나를 도와주세요. 나는 원래 L-1 규범 문제, 즉 올가미에서 KKT 조건을 사용하여 수학 증거를 …
12 lasso 

1
로지스틱 회귀 분석을위한 Hosmer-Lemeshow vs AIC
Hosmer-Lemeshow가 적합하지 않음을 나타내지 만 모든 모델 중에서 AIC가 가장 낮다면 .... 여전히 모델을 사용해야합니까? 변수를 삭제하면 Hosmer-Lemeshow 통계량이 중요하지 않습니다 (즉, 총 적합치가 없음을 의미 함). 그러나 AIC는 증가합니다. 편집 : 일반적으로 다른 모델의 AIC가 서로 가깝다면 (즉 ) 기본적으로 동일하다고 생각합니다. 그러나 AIC는 매우 다릅니다. 이것은 Hosmer-Lemeshow 테스트가 …

1
의사 결정 트리에서 이진 분할 구현의 차이점
나는 의사 결정 트리의 이진 분할의 실제 구현에 대한 호기심 - 그것은 범주 예측의 수준에 관련된 .XjXjX{j} 특히, 예측 정확도와 안정성을 향상시키기 위해 의사 결정 트리를 사용하여 예측 모델을 작성할 때 일종의 샘플링 방식 (예 : 배깅, 오버 샘플링 등)을 자주 사용합니다. 이러한 샘플링 루틴 동안, 범주 형 변수가 전체 …

9
멋진 그래프를 자동으로 만들려면 어떻게해야합니까?
예 : 이 페이지 http://store.steampowered.com/hwsurvey 와 같은 이 작업을 수행 할 수있는 기성품 소프트웨어가 있습니까? 또는 비슷한 기능을하는 다른 소프트웨어에 대한 권장 사항이 있습니까? 나는 이것이 실제로 통계 질문이 아니라는 것을 알고 있지만 효과적이기 위해서는 데이터가 깔끔하고 매력적인 방식으로 제시되어야한다고 생각합니다. 업데이트 (29/12/11) : 이 질문에 대한 모든 답변에 감사드립니다. …

2
교육 데이터에서 그룹 크기가 다른 SVM
한 그룹이 다른 그룹보다 더 많은 훈련 데이터를 사용하여 SVM을 구축하려고합니다. 그러나 그룹은 최종 테스트 데이터에서 동일하게 표시됩니다. 따라서 R 패키지 인터페이스 의 class.weights매개 변수 를 사용 하여 훈련 데이터에서 두 그룹의 영향을 균형있게 조정 하고 싶습니다 .e1071libsvm 이 가중치를 정확히 어떻게 지정해야하는지 잘 모르기 때문에 약간의 테스트를 설정했습니다. 일부 …

3
공개적으로 사용 가능한 데이터에 대한 호스팅 옵션
따라서 재현 가능한 연구 아이디어를 지원하기로 결정하고 사람들이보고 사용할 수 있도록 온라인에서 데이터를 사용할 수있게하려고합니다. 문제는 어디에서 호스팅합니까? 내 첫 번째 성향은 물론 대학 서버에있는 개인 웹 공간이지만, 실제로는 그렇게 오래 지속되지는 않습니다. 떠나면 디렉토리가 사라지기 전에 매우 짧은 시간 동안 열려 있습니다. 향후 사람들이 사용하고 작업 할 수 있도록 …

2
R에서 Monte Carlo 시뮬레이션을 사용한 근사 적분
MC 시뮬레이션을 사용하여 다음 적분을 어떻게 근사합니까? ∫1− 1∫1− 1| x-y|d xD Y∫−11∫−11|x−y|dxdy \int_{-1}^{1} \int_{-1}^{1} |x-y| \,\mathrm{d}x \,\mathrm{d}y 감사! 편집 (일부 상황) : 시뮬레이션을 사용하여 적분을 근사화하는 방법을 배우려고 노력하고 있으며 어려움을 겪을 때 연습을하고 있습니다. 편집 2 + 3 : 어떻게 든 혼란스러워서 적분을 별도의 부분으로 나눌 필요가 있다고 …

2
카운트 데이터 분산의 파라 메트릭 모델링
일부 데이터를 모델링하려고하는데 어떤 유형의 모델을 사용할 수 있는지 잘 모르겠습니다. 카운트 데이터가 있고 데이터의 평균과 분산 모두에 대한 모수 추정치를 제공하는 모델을 원합니다. 즉, 다양한 예측 요소가 있으며 그룹 평균뿐만 아니라 분산에 영향을 미치는지 확인하고 싶습니다. 분산이 평균과 같기 때문에 포아송 회귀가 작동하지 않는다는 것을 알고 있습니다. 이 가정은 …

4
고객에게 제공하기 위해 통계 학자와 상담하기위한 참고 자료
이 질문 은 Wikipedia와 같이 약하게 개발 된 리소스에 직면하여 통계와 확률을 스스로 익히는 사람의 어려움을 보여줍니다. 상담 통계 전문가와 여기에 몇 가지가 있으며, 고객에게 특정 개념과 방법을 설명하는 데 어려움을 겪을 수 있습니다. 이것은 교육학 동전의 뒤집힌면입니다. 개념을 숙달 한 경우 특정 분석 방법을 수행하는 것이 합리적 일 수 …

4
통계 도구를 부적절하게 사용하여 비용이 많이 드는 결과의 예
통계 도구를 사용하는 대부분의 사용자는 보조 사용자 (정식에 대한 공식 교육이 거의 없거나 아예없는 사람들) 인 것 같습니다. 동료 검토 논문, 회색 문헌, 웹 또는 회의에서“이전에 완료된”것을 보았 기 때문에 연구자와 다른 전문가들이 데이터에 통계적 방법을 적용하는 것은 매우 유혹적입니다. 그러나 필요한 가정과 통계 도구의 한계에 대한 명확한 이해없이 그렇게하면 …

5
PCA를 사용하여 군집 분석을위한 변수 선택을 수행 할 수 있습니까?
군집 분석을 수행하려면 변수 수를 줄여야합니다. 내 변수는 서로 밀접하게 관련되어 있으므로 요인 분석 PCA (주성분 분석) 를 수행 하는 것으로 생각했습니다 . 그러나 결과 점수를 사용하면 클러스터가 정확하지 않습니다 (문헌의 이전 분류와 비교). 질문: 회전 행렬을 사용하여 각 구성 요소 / 인자에 대해 가장 큰 부하를 갖는 변수를 선택하고 …

3
read.csv를 사용하여 3 개 열 중 2 개만 읽기
잠김 . 이 질문과 주제는 주제가 다르지만 역사적으로 중요하기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. 세 개의 열로 구성된 ascii 데이터 세트가 있지만 마지막 두 개만 실제 데이터입니다. 이제를 사용하여 데이터의 도트 차트를 만들고 싶습니다 read.csv(file = "result1", sep= " "). R은 세 열을 모두 …
12 r 

4
이항 분포 추정값
이항 분포에서 오는 데이터의 추정량을 어떻게 정의합니까? bernoulli의 경우 모수 p를 추정하는 추정기가 있다고 생각할 수 있지만 이항의 경우 분포의 특성을 분석 할 때 어떤 모수를 추정 할 수 없습니까? 최신 정보: 추정 기란 관측 된 데이터의 함수를 의미합니다. 추정기는 데이터를 생성하는 분포의 모수를 추정하는 데 사용됩니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.