통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
알파 및 베타가 큰 베타 분포의 값을 (숫자 적으로) 근사 적으로 계산하는 방법
큰 정수 알파, 베타에 대한 베타 분포 값을 계산하는 수치 적으로 안정적인 방법이 있습니까 (예 : alpha, beta> 1000000)? 실제로, 어떻게 든 문제를 쉽게 만들 수 있다면 모드 주위에 99 % 신뢰 구간 만 있으면됩니다. 추가 : 죄송합니다. 제 질문은 생각했던대로 명확하게 언급되지 않았습니다. 내가하고 싶은 것은 이것입니다 : 컨베이어 …


4
주어진 추정 기술과 변수에 대해 표본이 얼마나 커야합니까?
주어진 수의 매개 변수로 모형을 추정하기 위해 표본이 얼마나 큰지를 알려줄 수있는 경험이 있습니까? 예를 들어, 5 개의 모수로 최소 제곱 회귀를 추정하려면 표본의 크기는 얼마입니까? 사용중인 추정 기술 (예 : 최대 가능성, 최소 제곱, GMM) 또는 수행 할 테스트 수 또는 몇 가지가 중요합니까? 결정을 할 때 표본 변동성을 …

3
이진 데이터 클러스터링이 중요한지 어떻게 테스트 할 수 있습니까?
장바구니를 분석하고 있습니다. 데이터 세트가 구매 한 상품과 함께 거래 벡터 세트입니다. 거래에 K-수단을 적용 할 때, 난 항상 얻을 것이다 어떤 결과를. 임의 행렬은 아마도 일부 군집을 보여줄 것입니다. 내가 찾은 클러스터링이 중요한지 또는 우연의 일치인지 테스트하는 방법이 있습니까? 그렇다면 어떻게 할 수 있습니까?

1
점의 두 값 사이에 통계적으로 의미있는 특이 치 비율이 큰 표본 점을 찾는 방법은 무엇입니까?
예제 응용 프로그램으로 Stack Overflow 사용자의 두 가지 속성 인 평판 및 프로필보기 수를 고려하십시오 . 대부분의 사용자에게는이 두 값이 비례합니다. 높은 응답 사용자는 더 많은 관심을 끌고 더 많은 프로필보기를 얻습니다. 따라서 전체 평판에 비해 많은 프로필 조회수를 가진 사용자를 검색하는 것이 흥미 롭습니다. 이는 사용자에게 외부 명성 소스가 …
12 ratio 

1
(팬더) 자기 상관 그래프는 무엇을 보여줍니까?
나는 초보자이며 자기 상관 그래프가 보여주는 것을 이해하려고합니다. 이 페이지 또는 여기에 인용되지 않은 관련 Wikipedia 페이지 와 같은 다른 출처의 여러 설명을 읽었습니다 . 나는이 매우 간단한 코드를 가지고 있는데, 1 년 동안 색인에 날짜가 있고 각 색인에 대해 값이 단순히 0에서 365로 증가합니다. ( 1984-01-01:0, 1984-01-02:1 ... 1984-12-31:365) …

1
백도어와 프론트 도어 조정의 차이점에 대한 평신도 이해
나는 뒷문 조정과 앞문 조정을 여기에서 언급하고 있습니다 : 백도어 조정 : 통계의 전형적인 역학 문제는 측정 된 혼란 자의 효과를 조정하는 것입니다. Pearl의 백도어 기준은이 아이디어를 일반화합니다. 앞문 조정 : 일부 변수가 관찰되지 않으면 인과 관계 효과를 식별하기 위해 다른 방법을 사용해야 할 수도 있습니다. 이 페이지에는 위의 두 …
12 causality  dag 

2
ML의 softmax 기능과 열역학의 Boltzmann 분포 사이의 연결은 얼마나 깊습니까?
실수를 확률로 변환하기 위해 신경망에서 일반적으로 사용되는 softmax 함수는 열역학에서 주어진 온도 T에서 열 평형에서 입자의 앙상블에 대한 에너지에 대한 확률 분포 인 Boltzmann 분포와 동일한 기능입니다. 이것이 실용적인 이유에 대한 명확한 휴리스틱 이유를 볼 수 있습니다. 입력 값이 음수인지에 관계없이 softmax는 1에 해당하는 양수 값을 출력합니다. 항상 차별화가 가능하므로 …

3
시계열 데이터를 기차 / 테스트 / 검증 세트로 분할
시계열 데이터를 기차 / 테스트 / 검증 세트로 분할하는 가장 좋은 방법은 무엇입니까? 여기서 유효성 검사 세트는 하이퍼 파라미터 튜닝에 사용됩니까? 우리는 3 년 분량의 일일 판매 데이터를 보유하고 있으며, 2015-2016 년을 교육 데이터로 사용한 다음 2017 년 데이터에서 10 주를 무작위로 샘플링하여 유효성 검사 세트로 사용하고 2017 년 데이터에서 …


2
CNN에서 필터 크기, 보폭 등을 선택합니까?
스탠포드의 CS231N 강의를보고 있었고 CNN 아키텍처의 일부 문제를 해결하려고 노력하고 있습니다. 내가 이해하려고하는 것은 컨볼 루션 필터 크기와 보폭과 같은 것들을 선택하기위한 일반적인 지침이 있거나 이것이 과학보다 예술입니까? 풀링은 주로 어떤 형태의 번역 불일치를 모델로 유도하기 위해 존재한다는 것을 이해합니다. 반면에, 보폭이 어떻게 선택되는지에 대한 좋은 직감이 없습니다. 현재 레이어 …




1
Jacobian factor로 인한 다른 확률 밀도 변환
주교의 패턴 인식 및 기계 학습 에서 확률 밀도 가 소개 된 .p(x∈(a,b))=∫bap(x)dxp(x∈(a,b))=∫abp(x)dxp(x\in(a,b))=\int_a^bp(x)\textrm{d}x 변수의 비선형 적 변화에서 확률 밀도는 야 코비 행렬 (Jacobian factor)로 인해 간단한 함수와 다르게 변형됩니다. 예를 들어 변수 의 변경을 고려하면 함수 는 됩니다. 이제 새 변수 와 관련하여 밀도 해당 하는 확률 밀도 를 고려하십시오 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.