통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
R에서 더미 코딩 대신 효과 코딩으로 회귀를 수행하는 방법은 무엇입니까?
현재 범주 형 / 요인 변수 만 독립 변수로 사용하는 회귀 모델을 작성 중입니다. 내 종속 변수는 로짓 변환 비율입니다. R이 "인자"유형 인 즉시 인형을 코딩하는 방법을 자동으로 알기 때문에 R에서 정상적인 회귀를 실행하는 것은 매우 쉽습니다. 그러나 이러한 유형의 코딩은 또한 각 변수에서 하나의 범주가 기준으로 사용되어 해석하기 어렵다는 …


1
곡선 적합에서 공분산 행렬을 어떻게 해석합니까?
나는 통계가 너무 좋지 않아서 이것이 단순한 질문이라면 사과드립니다. 일부 데이터에 곡선을 맞추고 때로는 내 데이터가 형식으로 음의 지수에 가장 잘 맞으며 때로는 적합이 a * e ( − b * x 2 )에 더 가깝습니다 . + c . 그러나 때로는 둘 다 실패하고 선형 피팅으로 돌아가고 싶습니다. 내 …


1
스플라인을 사용하여 밀도 함수의 국소 극한값 찾기
확률 밀도 함수 (R의 density방법을 사용하여 찾음)에 대한 로컬 최대 값을 찾으려고합니다 . 많은 양의 데이터가 있기 때문에 간단한 "인접 이웃 둘러보기"방법을 사용할 수 없습니다 (이것은 주변 이웃에 대해 로컬 최대 값인지 확인하기 위해 포인트를 둘러 보는 방법). 또한 내결함성 및 기타 매개 변수를 사용하여 "이웃을 둘러보기"를 구축하는 것과 달리 …
15 r  pdf  splines  maximum 

2
일부 대기가 더 많은 대기를 예상하는 상황을 반영하는 배포
Peter Thiel의 스타트 업 강의에 대한 Blake Master의 노트를 읽으 면서 기술 프론티어에 대한 이 은유 를 발견했습니다. 연못, 호수, 바다로 덮여있는 세상을 상상해보십시오. 당신은 보트, 물 속에 있습니다. 그러나 안개가 심해서 상대방과의 거리를 모릅니다. 연못, 호수 또는 바다에 있는지 알 수 없습니다. 연못에 있다면 교차하는 데 약 1 시간이 …

4
결정 론적 세계에서 기회의 운영
Steven Pinker의 저서 "천사의 더 나은 천사들" 에서 그는 확률은 관점의 문제입니다. 충분히 가까운 거리에서 볼 때 개별 이벤트는 원인을 결정합니다. 시작 조건과 물리 법칙에서 코인 플립도 예측할 수 있으며 숙련 된 마술사는 이러한 법을 이용하여 매번 머리를 던질 수 있습니다. 그러나 우리가 이러한 많은 사건들을 광각으로보기 위해 축소 할 …

4
ROC 곡선의 장점
ROC 곡선의 장점은 무엇입니까? 예를 들어 바이너리 분류 문제 인 일부 이미지를 분류하고 있습니다. 약 500 개의 기능을 추출하고 기능 선택 알고리즘을 적용하여 기능 세트를 선택한 다음 분류를 위해 SVM을 적용했습니다. 이 경우 어떻게 ROC 곡선을 얻을 수 있습니까? 기능 선택 알고리즘의 임계 값을 변경하고 ROC 곡선을 그리려면 출력의 감도와 …


1
카이-제곱 기능 선택은 정확히 어떻게 작동합니까?
각 피처-클래스 쌍에 대해 카이-제곱 통계 값이 계산 되고 임계 값과 비교됩니다. 그래도 조금 혼란 스럽습니다. 피처와 클래스 가 있다면 우발성 테이블을 어떻게 구축합니까? 유지할 기능과 제거 할 기능을 어떻게 결정합니까?미디엄미디엄m케이케이k 어떤 설명이라도 대단히 감사하겠습니다. 미리 감사드립니다

3
강력한 평균 추정의 충돌 과정
나는 (1000 정도의) 추정치가 많으며 모두 장기 탄력성의 추정치입니다. 이 중 절반 이상이 방법 A를 사용하고 나머지는 방법 B를 사용하여 추정됩니다. 어딘가에서 "방법 B 가 방법 A와 매우 다른 것으로 추정합니다. 추정치가 훨씬 높기 때문에 (50-60 %) ". 강력한 통계에 대한 나의 지식은 아무것도 아닙니다. 그래서 나는 두 표본의 표본 …

7
주식 시장을 예측하기 위해 어떤 기계 학습 알고리즘을 사용할 수 있습니까?
또는 외환 시장을 예측합니다. 나는 이것이 꽤 복잡해질 수 있다는 것을 알고 있으므로 소개로서 정확성이있는 간단한 예측 알고리즘을 찾고 있습니다. (4 개월간 지속되는 M.Sc. 대학교 프로젝트) 다층 신경망이 유용 할 수 있다는 것을 읽었습니다. 그것에 대한 생각? 또한 소셜 미디어의 의미 론적 분석은 주식 시장에 영향을 미치는 시장 행동에 대한 …



2
큐 이론 문제의 도착 과정을 모델링하기 위해 푸 아송 분포를 선택한 이유는 무엇입니까?
개인이 서빙 노드에 도착하고 대기하는 대기열 이론 시나리오를 고려할 때 일반적으로 포아송 프로세스가 도착 시간을 모델링하는 데 사용됩니다. 이러한 시나리오는 네트워크 라우팅 문제에서 발생합니다. 포아송 프로세스가 도착을 모델링하는 데 가장 적합한 이유에 대한 직관적 인 설명에 감사드립니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.