통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
CARET에서 매개 변수 튜닝 (그리드) 기능을 비활성화하는 방법이 있습니까?
CARET은 사전 지정된 튜닝 그리드를 사용하여 최종 모델을 선택하기 전에 다양한 모델을 구축 한 다음 전체 모델에 대한 최종 모델을 학습합니다. 매개 변수 조합을 하나만 사용하여 자체 조정 그리드를 제공 할 수 있습니다. 그러나이 경우에도 CARET은 튜닝 매개 변수 중에서이 모델에 가장 적합한 모델을 "선택"하고 (이 경우에는 하나만 있음) 최종 …
15 r  caret 

5
선형 모형에서 중요하지 않은 수준의 요인에 대한 계수를 무시할 수 있습니까?
여기서 선형 모델 계수에 대한 설명을 찾은 후 요인 수준 계수에 대한 비의 미적 (높은 p 값)에 대한 후속 질문이 있습니다. 예 : 선형 모델에 10 개의 수준이있는 요인이 포함되어 있고 해당 수준 중 3 개만 관련 p 값이있는 경우 모형을 사용하여 Y를 예측할 때 대상이 다음 중 하나에 해당하는 …

3
표준 편차를 어떻게 평가합니까?
특정 작업을 수행 할 수있는 능력에 대한 85 명의 응답을 수집했습니다. 응답은 5 점 리 커트 척도에 있습니다. 5 = 매우 좋음, 4 = 좋음, 3 = 평균, 2 = 나쁨, 1 = 매우 나쁨, 평균 점수는 2.8이고 표준 편차는 0.54입니다. 평균 및 표준 편차의 의미를 이해합니다. 내 질문은이 표준 …


4
전문가는 해롭습니까?
내가 읽고 있어요 "인공 지능 연구에서 체스의 역할" ( PDF 파일 ) 흥미롭게도, 그것은 말합니다 : 경험 [...]은 체스 전문가의 의견은 일반적으로 유용하지만 완전히 신뢰할 수는 없다고 제안합니다. 이에 대한 좋은 예는 Deep Thought의 평가 기능입니다. 유능한 인간 체스 전문가에 의한 몇 가지 변화는 크게 개선되지 않았으며 때로는 기계 성능에 …

3
실질적으로 좋은 데이터 분석 프로세스는 무엇입니까?
대부분의 통계 데이터 분석가가 각 데이터 분석 프로젝트를 수행하는 분석 프로세스를 알고 있거나 참조하고 싶습니다. "목록"을 작성하면 데이터 분석 프로젝트를 완료하기 위해 분석가는 다음을 수행해야합니다. 먼저 프로젝트 요구 사항을 수집하고 이전의 요구 사항을 기반으로 데이터 분석 계획 / 설계 실제로 전처리 데이터 데이터 분석 및 그의 분석 결과에 따라 보고서를 …

2
유전자 프로그래밍에 사용할 언어
과제의 일환으로 대기 오염 물질 수준을 예측 하는 유전자 프로그래밍 알고리즘 을 작성해야 합니다. 나는 경험이 없기 때문에 누구나 진화 된 프로그램이 작성 될 프로그래밍 언어의 제안에 대한 포인터를 알려줄 수 있습니까 ? 설명 : 나는 유전자 알고리즘 자체를 작성할 언어가 무엇인지 묻지 않고 (결정을 내릴 수 있기 때문에) 진화 …

2
LASSO / LARS 및 일반 대 특정 (GETS) 방법
왜 LASSO 및 LARS 모델 선택 방법이 기본적으로 단계별 순방향 선택의 변형이지만 경로 의존성을 겪을지라도 왜 그렇게 인기가 있는지 궁금합니다. 마찬가지로, 단계 선택 회귀 문제를 겪지 않기 때문에 LARS / LASSO보다 더 나은 모델 선택을위한 GETS (General to Specific) 방법이 왜 대부분 무시 되는가? (GETS에 대한 기본 참조 : http://www.federalreserve.gov/pubs/ifdp/2005/838/ifdp838.pdf- …

4
고지방 데이터로 분류
수십만 개의 데이터 포인트와 약 10 만 개의 기능을 갖춘 랩톱에서 선형 분류기를 훈련시켜야합니다. 내 옵션은 무엇입니까? 이 유형의 문제에 대한 최신 기술은 무엇입니까? 확률 적 그라디언트 하강이 유망한 방향 인 것 같습니다. 제 감각은 이것이 최첨단이라는 것입니다. "Pegasos : SVM을위한 초기 추정 서브 그 레이디 언트 솔버"Shai Shalev-Shwartz, Yoram …

2
대규모 데이터 세트에 대한 유의 수준을 선택하는 방법은 무엇입니까?
N이 약 200,000 인 데이터 세트로 작업하고 있습니다. 회귀에서, 매우 작은 효과 크기와 관련된 매우 작은 유의성 값 << 0.001, 예를 들어 r = 0.028을보고 있습니다. 내가 알고 싶은 것은 표본 크기와 관련하여 적절한 유의성 임계 값을 결정하는 원칙적인 방법이 있습니까? 이러한 큰 샘플로 효과 크기를 해석 할 때 고려해야 …

2
Cox 비례 위험 모델로 교차 검증을 수행하는 방법은 무엇입니까?
하나의 데이터 세트 (모델 구축 데이터 세트)에서 특정 질병의 발생에 대한 예측 모델을 구성했으며 이제 새 데이터 세트 (유효성 검증 데이터 세트)에서 모델이 얼마나 잘 작동하는지 확인하려고합니다. 로지스틱 회귀로 작성된 모델의 경우 모델 빌딩 데이터 세트에서 얻은 모델 계수를 기반으로 유효성 검사 데이터 세트의 각 사람에 대한 예측 확률을 계산 …

2
R에서 파티셔닝 트리 : 파티와 rpart
나무 분할을 살펴본 후 오랜 시간이 지났습니다. 지난번에 이런 일을했을 때, 나는 R의 파티 (핫혼이 만든)를 좋아합니다. 샘플링을 통한 조건부 추론에 대한 아이디어는 나에게 의미가 있습니다. 그러나 rpart도 호소했습니다. 현재 응용 프로그램에서 (세부 사항을 말할 수는 없지만 많은 피구금자 중 누가 감옥에 갈 것인지 결정하려고합니다) 임의의 숲, 가방, 부스팅 등의 …
15 r  cart  rpart  partitioning 

3
컴퓨터 실에서 R을 가르치는 좋은 방법은 무엇입니까?
이 몇 가지 좋은 질문과 소개 책에 대한 답변 세트되고 또는 R의 예를 학습에 접근 한 여기 와 여기 . 그러나 약간 다른 문제가 있습니다. 컴퓨터 실습실에서 한 시간 동안 세션을 실행하는 가장 좋은 방법은 사람들이 R에서 시작하여 기본적인 접근 방식에 익숙해 지도록하는 가장 좋은 방법입니다. 나의 현재 계획은 Verzani의 …
15 r  teaching 

1
연속 변수를 예측할 때 의사 결정 트리 분할을 어떻게 구현해야합니까?
실제로 Random Forests의 구현을 작성하고 있지만 질문은 의사 결정 트리 (RF와 무관)에만 국한된다고 생각합니다. 따라서 컨텍스트는 의사 결정 트리에서 노드를 만들고 예측 변수와 대상 변수가 모두 연속적이라는 것입니다. 노드에는 데이터를 두 세트로 분할하기위한 분할 임계 값이 있으며 각 세트의 평균 목표 값을 기반으로 각 서브 세트에 대한 새로운 예측을 작성합니다. …


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.