통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
비대칭 데이터를 사용한 회귀
인구 통계 및 서비스에서 방문수를 계산하려고합니다. 데이터가 매우 왜곡되어 있습니다. 히스토그램 : qq 플롯 (왼쪽은 로그) : m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) city및 service요인 변수입니다. 모든 변수에 대해 낮은 p 값 ***을 얻지 만 r의 제곱도 .05입니다. 어떻게해야합니까? 지수 또는 다른 것과 같은 다른 모델이 작동합니까?

3
응용 확률 학습을위한 좋은 책?
저는 확률 이론에 대한 깊고 엄격한 적용 범위를 제공하지만 수학 부서 외부에서 주로 유용한 자료에 중점을 둔 책을 찾고 있습니다. "확률 이론 : 탐색 및 응용 프로그램"이 꽤 좋다고 들었지만 다른 제안을 원했습니다. 예를 들어, Achim Klenke의 책은 나에게 너무나 많은 책입니다. 그것은 내가 말할 수있는 한 응용 프로그램이 아니라 …

3
또 다른 중심 제한 정리 문제
하자 독립적 베르누이 랜덤 변수들의 시퀀스 일 집합 보여 표준 정규 분포 변수로 수렴 등이 무한대.{Xn:n≥1}{Xn:n≥1}\{X_n:n\ge1\}P{Xk=1}=1−P{Xk=0}=1k.P{Xk=1}=1−P{Xk=0}=1k.P\{X_k=1\}=1-P\{X_k=0\}=\frac{1}{k}.Sn=∑k=1n(Xk−1k), B2n=∑k=1nk−1k2Sn=∑k=1n(Xk−1k), Bn2=∑k=1nk−1k2S_n=\sum^{n}_{k=1}\left(X_k-\frac{1}{k}\right), \ B_n^2=\sum^{n}_{k=1}\frac{k-1}{k^2}SnBnSnBn\frac{S_n}{B_n}ZZZnnn 내 시도는 그러므로 우리가 존재 보여줄 필요가, 아프 노프 CLT를 사용하는 것입니다 등, 그 δ>0δ>0\delta>0limn→∞1B2+δn∑k=1nE[|Xk−1k|2+δ]=0.limn→∞1Bn2+δ∑k=1nE[|Xk−1k|2+δ]=0.\lim_{n\rightarrow \infty}\frac{1}{B_n^{2+\delta}}\sum_{k=1}^{n}E[|X_k-\frac{1}{k}|^{2+\delta}]=0. 따라서 δ=1δ=1\delta=1∑k=1nE∣∣Xk−k−1∣∣3=∑k=1n(1k−3k2+4k3−2k4)∑k=1nE|Xk−k−1|3=∑k=1n(1k−3k2+4k3−2k4) \sum_{k=1}^{n}E\left|X_k-k^{-1}\right|^{3}=\sum_{k=1}^{n} \left(\frac{1}{k}-\frac{3}{k^2}+\frac{4}{k^3}-\frac{2}{k^4}\right) 및 B3n=(∑k=1n1k−1k2)(∑k=1n1k−1k2)−−−−−−−−−−−−⎷Bn3=(∑k=1n1k−1k2)(∑k=1n1k−1k2) B_n^3=\left( \sum_{k=1}^n \frac{1}{k}-\frac{1}{k^2} \right) \sqrt{\left( \sum_{k=1}^n \frac{1}{k}-\frac{1}{k^2} \right)} …

1
AlphaGo의 논문에서 롤아웃 정책은 무엇입니까?
종이는 여기에 있습니다 . 롤아웃 정책 ...은 점진적으로 계산 된 로컬 패턴 기반 기능을 기반으로하는 선형 softmax 정책입니다 ... 롤아웃 정책이 무엇인지, 그리고 정책 선택이 이동을 선택하는 정책 네트워크와 어떤 관련이 있는지 이해하지 못합니다. 더 간단한 설명이 있습니까?

1
함수 근사값으로 신경망을 이용한 Q- 러닝
신경망을 이용한 Q- 러닝에 관한 질문 에서와 같이 Q- 러닝의 Q- 값을 근사하기 위해 신경망을 사용하려고합니다 . 첫 번째 답변에서 제안했듯이 출력 레이어에 선형 활성화 기능을 사용하고 있지만 숨겨진 레이어에서 시그 모이 드 활성화 기능을 계속 사용하고 있습니다 (2, 나중에 변경할 수는 있음). 또한 조언 된대로 각 작업 대한 출력을 …

3
확률 적 컴퓨터 모델의 최적화
검색에 단어 최적화 및 확률론이 거의 자동으로 확률 론적 최적화에 대한 검색으로 기본 설정되어 있기 때문에 이것은 나에게 구글에게 힘든 주제입니다. 그러나 내가 정말로 알고 싶은 것은 컴퓨터 모델 출력이 확률적일 때, 즉 결정적이지 않을 때 컴퓨터 모델을 최적화하기 위해 어떤 방법이 존재하는지입니다. 예를 들어, 컴퓨터 모델 의 출력을 나타내는 …

1
SVM과 비교하여 Support Vector Regression은 어떻게 다릅니 까?
SVM 및 SVR에 대한 기본 사항을 알고 있지만 여전히 여백을 최대화하는 하이퍼 플레인을 찾는 문제가 SVR에 어떻게 부합하는지 알 수 없습니다. 둘째, SVR에서 허용 오차로 사용 된 에 대한 내용을 읽었습니다 . 무슨 뜻이에요?ϵϵ\epsilon 셋째, SVM과 SVR에 사용 된 의사 결정 기능 매개 변수간에 차이가 있습니까?

3
Word2Vec의 스킵 그램 모델은 어떻게 출력 벡터를 생성합니까?
Word2Vec 알고리즘의 스킵 그램 모델을 이해하는 데 문제가 있습니다. 연속 단어 단위로 신경망에서 문맥 단어가 어떻게 "맞을"수 있는지 쉽게 알 수 있습니다. 기본적으로 각각의 one-hot 인코딩 표현에 입력 행렬 W를 곱한 후 평균을 계산하기 때문입니다. 그러나 skip-gram의 경우 one-hot encoding과 입력 행렬을 곱하여 입력 단어 벡터 만 얻은 다음 컨텍스트 …

2
Bayes Classifier가 이상적인 분류자인 이유는 무엇입니까?
범주의 기초가되는 확률 구조가 완벽하게 알려진 이상적인 경우로 간주됩니다. 왜 Bayes 분류기를 사용하여 달성 할 수있는 최고의 성능을 달성 할 수 있습니까? 이에 대한 공식적인 증거 / 설명은 무엇입니까? 우리는 항상 다른 모든 분류기의 성능을 비교하기 위해 Bayes 분류기를 벤치 마크로 사용합니다.

2
의사 결정 트리 및 회귀-예측 값이 교육 데이터 범위를 벗어날 수 있습니까?
의사 결정 트리와 관련하여 예측 값이 교육 데이터 범위를 벗어날 수 있습니까? 예를 들어, 대상 변수의 학습 데이터 세트 범위가 0-100 인 경우 모델을 생성하고 다른 것으로 적용 할 때 내 값은 -5 일 수 있습니까? 또는 150? 의사 결정 트리 회귀에 대한 나의 이해는 여전히 규칙 기반입니다-왼쪽 / 오른쪽 …

3
고정밀 또는 리콜 이진 분류기를 얻기 위해 어떤 손실 함수를 사용해야합니까?
슬라이딩 / 크기 조정 창에 적용된 CNN 이진 분류기를 사용하여 매우 드물게 발생하는 물체 (이미지에서)를 탐지하려고합니다. 균형 잡힌 1 : 1 양의 음수 훈련 및 테스트 세트를 구성했으며 (이 경우 btw입니까?) 분류기는 정확도 측면에서 테스트 세트에서 잘 수행됩니다. 이제 분류기의 리콜 / 정밀도를 제어하고 싶습니다. 예를 들어, 대다수 클래스 발생에 …

1
알고리즘 : 값이 확실하지 않은 경우 이진 검색
각 단계의 테스트에서 잘못된 결과가 나올 때 이진 검색을 수행하는 알고리즘이 필요합니다. 배경 : 학생들을 12 가지 난이도 수준 중 가장 적절한 곳에 배치해야합니다. 현재의 접근 방식은 무차별 적이며 난이도 증가, 세 가지 잘못 후 중단 floor((score - 1) / 5) + 1, 최소 1의 수준으로 학생을 배치하는 60 가지의 …
11 algorithms 

1
교차 공분산 행렬이 0이 아닌지 테스트하는 방법은 무엇입니까?
내 연구의 배경 : 깁스 샘플링에서 어디 샘플 XXX (관심의 가변) 및 YYY 에서 P(X|Y)P(X|Y)P(X|Y) 및 P(Y|X)P(Y|X)P(Y|X) 는 각각 XXX 및 YYY 있는 kkk 차원 랜덤 벡터. 프로세스는 일반적으로 두 단계로 나뉩니다. 모든 샘플을 폐기하는 번인 기간. 샘플은 X1∼XtX1∼XtX_1\sim X_t 및 로 나타냅니다 Y1∼YtY1∼YtY_1\sim Y_t. 샘플을 평균화하는 "애프터 번인"기간 X¯=1k∑ki=1Xt+iX¯=1k∑i=1kXt+i\bar{X} …

2
Secret Santa 배열이 완벽한 페어링을 제공 할 가능성
그래서 우리는 직장에서 Secret Santa을 가졌습니다. 우리는 8 명입니다. 우리는 각각 차례를 바꾸어 그릇에 이름이 적힌 작은 종이를 가져 왔습니다. 유일한 규칙 : 이름을 당기면 종이를 그릇에 넣고 다시 시도해야합니다. 사람들 A, B, C, D, E, F, G, H에게 전화를 걸자. 그들은 종이를 집어 넣는 순서이기도하다. 어젯밤 선물 교환을 했어 …

2
“가장 강력한 비밀번호”
4 자리 PIN으로 보호되는 앱이 있는데 계정이 잠기기 전에 사용자가 5 번 로그인을 시도했습니다. 이제 고객 중 한 명이 보안을 "강화"하고 다른 솔루션을 옹호하려고합니다. 6 자리 PIN 아니오 "서로 같은 숫자": 예 : 11 3945 또는 39 55 94 NO "세 가지 실행 수 없습니다": 예 : 123 654 또는 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.