통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
AI의 초파리는 무엇입니까?
1960 년대 중반 연구자들은 체스를 " AI의 초파리 (Drosophila of AI)" 라고 불렀습니다 . 과일 파리처럼 체스 게임은 접근하기 쉽고 상대적으로 간단한 문제는 실험했지만, 여전히 중요한 지식은 더 복잡한 문제를 만들어 냈습니다. 이제 사람들은 "체스 만 검색 문제"라고 말하고 "체스 방법은 AI 커뮤니티에 더 이상 관심을 갖지 않을 것"이라고 말합니다. …

3
데이터가 포함 된 실용적인 PCA 튜토리얼
인터넷에서 PCA 튜토리얼을 검색하면 수천 개의 결과 (동영상)가 제공됩니다. 많은 튜토리얼이 매우 좋습니다. 그러나 데모에 사용할 수있는 일부 데이터 세트를 사용하여 PCA를 설명하는 실용적인 예를 찾을 수 없습니다. PCA 분석 전후에 플롯하기 쉬운 작은 데이터 세트 (10000s의 데이터가 아닌 10000s의 라인이 아님)를 제공하는 자습서가 필요하며 차이 / 결과를 명확하게 보여줄 …

1
이상 감지를위한 자동 기능 선택
이상 감지를위한 기능을 자동으로 선택하는 가장 좋은 방법은 무엇입니까? 어떤 중요한 것은 출력입니다 : 나는 일반적으로 기능이 인간의 전문가들에 의해 선택 알고리즘으로 변형 탐지 치료 범위 너무도 많은 기능을 당신은 - ( "이상 출력 이상 입력"에서와 같이) 할 수 있습니다 결합하여 훨씬 작은 부분 집합을 마련 특징. 그러나 일반적으로 기능 …

1
베이지안 네트워크에서 마르코프 블랭킷 대 정상적인 의존성
Bayesian 네트워크에 대해 읽는 동안 " Markov blanket "이라는 용어가 나오고 Bayesian 네트워크 그래프에서 독립성과 심각하게 혼동되었습니다. Markov 담요는 간단히 모든 노드는 부모, 자녀 및 부모에게만 의존한다고 말합니다 (그림에서 노드 A의 회색 영역입니다). 이 BN, P(M,S,G,I,B,R)P(M,S,G,I,B,R)P(M,S,G,I,B,R) 의 결합 확률은 얼마입니까? (출처 : aiqus.com ) 단계 부모 만 독립 규칙을 따르는 …

4
일부 연결을 제거하여 더 나은 ANN을 얻을 수 있습니까?
예를 들어 어떤 상황에서 ANN이 연결을 제거하면 ANN이 더 나은 성능을 발휘할 수 있는지 궁금합니다. A와 B의 숨겨진 레이어 사이에 몇 개의 "통신"연결을 추가하여 두 개의 다중 레이어 ANN의 A와 B를 동일한 입력 및 출력 노드로 병렬 연결하여 하나의 ANN을 구성합니까? 더 나은 일반화 결과를 얻을 수 있습니까? 이것은 실제로 …

4
회귀 모델에서 오류를 개념화하는 방법은 무엇입니까?
데이터 분석 수업에 참석하고 있으며 뿌리 깊은 아이디어가 흔들리고 있습니다. 즉, 오차 (엡실론)와 다른 종류의 분산은 그룹 (표본 또는 전체 모집단)에만 적용됩니다. 이제, 회귀 가정 중 하나는 분산이 "모든 개인에게 동일"하다는 것입니다. 이것은 어떻게 든 나에게 충격이다. 나는 항상 일정한 것으로 가정 된 모든 X 값에 대한 Y의 편차라고 생각했습니다. …



1
기준 모집단을 고려하여 성공 확률 추정
다음과 같은 상황이 있다고 가정하십시오. 시간이 지남에 따라 각각 1000 명 정도의 볼링 선수가 관찰되었습니다. 각 플레이어가 한 게임 수에 대한 각 플레이어의 스트라이크 비율을 기록했습니다. 새로운 볼링 선수가 와서 10 경기를 치고 3 타점을받습니다. 어떤 플레이어의 타격 횟수에 대한 분포는 이항으로 가정합니다. 그 선수의 "진정한"성공 확률을 추정하고 싶습니다. 다음 …


1
2 클래스 모델을 멀티 클래스 문제로 확장
Adaboost에 대한 이 백서는 2 클래스 모델을 K 클래스 문제로 확장하기위한 몇 가지 제안과 코드 (17 페이지)를 제공합니다. 다른 2 클래스 모델을 쉽게 연결하고 결과를 비교할 수 있도록이 코드를 일반화하고 싶습니다. 대부분의 분류 모델에는 수식 인터페이스와 predict방법이 있으므로이 중 일부는 비교적 쉽습니다. 불행히도 2 클래스 모델에서 클래스 확률을 추출하는 표준 …

1
규칙을 사용하여 새 데이터에 적합한 규칙 찾기
R (및 arules 패키지)을 사용하여 연결 규칙에 대한 마이닝 트랜잭션을 사용하고 있습니다. 내가하고 싶은 것은 규칙을 구성 한 다음 새로운 데이터에 적용하는 것입니다. 예를 들어, 많은 규칙이 있는데 그 중 하나는 표준 규칙 {Beer=YES} -> {Diapers=YES}입니다. 그런 다음 레코드 중 하나가 맥주를 구입했지만 기저귀는 구입하지 않은 새로운 거래 데이터가 있습니다. …

3
동전을 뒤집을 때 이항 cdf 또는 일반 cdf를 사용해야합니까?
공정성을 위해 동전을 테스트해야합니다. 50 번 넘겼을 때 30 개의 머리가 나옵니다. 동전이 공정하다고 가정하면, 50 번의 플립에서 30 번 이상의 헤드를 얻을 확률은 얼마입니까? 선생님에 따르면이 문제를 해결하는 올바른 방법은 normalcdf(min = .6, max = ∞, p = .5, σ = sqrt(.5 * .5 / 50) = 0.0786 그러나 …

2
예를 들어 요일을 기준으로 한 회귀
올바른 방향으로 움직이려면 약간의 도움이 필요합니다. 통계를 연구 한 지 오랜 시간이 걸리고 전문 용어가 변경된 것 같습니다. 다음과 같은 자동차 관련 데이터 세트가 있다고 가정하십시오. A 타운에서 B 타운까지의 여정 시간 마을 A에서 마을 B까지의 거리 엔진 크기 운전자의 신발 사이즈 자동차 제조사 및 모델 요일 여행 시간을 예측하고 …

1
R의 타임 라인에 이벤트 플로팅
시작 및 중지 시간의 데이터 프레임을 다음과 같은 타임 라인 플롯으로 변환 할 수있는 R 용 플롯 라이브러리가 있습니까? Y 축은 동시성으로 스택되지만 항상 동시성을 나타내는 것은 아닙니다 (중간 간격 참조). 각 회색 상자는 데이터 프레임의 행인 이벤트입니다. 데이터 프레임에는 시작 시간과 중지 시간의 두 열이 있습니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.