통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
"교차 엔트로피"의 정의와 기원
출처를 언급하지 않고 Wikipedia 는 불연속 분포 와 의 교차 엔트로피를 다음 과 같이 정의합니다 .피피P큐큐Q H×( P; Q )= − ∑엑스p ( x )로그큐( x ) .H×(피;큐)=−∑엑스피(엑스)로그⁡큐(엑스).\begin{align} \mathrm{H}^{\times}(P; Q) &= -\sum_x p(x)\, \log q(x). \end{align} 이 수량을 처음 사용하기 시작한 사람은 누구입니까? 그리고 누가이 용어를 발명 했습니까? 나는 보았다 …


2
3 개의 상관 분포 분포 랜덤 변수 생성
우리가 가지고 있다고 가정 X 2 ~ unif ( n , 0 , 1 ) ,X1∼unif(n,0,1),X1∼unif(n,0,1),X_1 \sim \textrm{unif}(n,0,1), X2∼unif(n,0,1),X2∼unif(n,0,1),X_2 \sim \textrm{unif}(n,0,1), 여기서 은 크기 n의 균일 한 랜덤 샘플입니다.unif(n,0,1)unif(n,0,1)\textrm{unif}(n,0,1) Y=X1,Y=X1,Y=X_1, Z=0.4X1+1−0.4−−−−−−√X2.Z=0.4X1+1−0.4X2.Z = 0.4 X_1 + \sqrt{1 - 0.4}X_2. 그런 다음 와 Z 의 상관 관계 는 0.4 입니다.YYYZZZ0.40.40.4 이 변수를 …

4
온라인 포커 사이트가 공정한지 확인하는 방법?
지난주에 나는 좋은 친구와 흥미로운 토론을했습니다. 그는 온라인 포커를 해왔으며 새로운 구독 / 추가 송금과 처리하는 카드 사이에 관계가 있다고 제안했습니다. 즉, 좋은 카드를 구해야합니다. 이것이 사실이라면 사이트는 아마도 많은 위험을 감수하고 있지만 문제는 여전히 나를 매료시킵니다. 이것에 대한 나의 첫번째 접근법은 친구에게 "좋은 카드"를 정의하고 간단한 이항 테스트 를하도록 …

2
동전을 뒤집어 분류기 결합
기계 학습 과정을 공부하고 있는데 강의 슬라이드에는 권장 도서와 모순되는 내용이 포함되어 있습니다. 문제는 다음과 같습니다. 세 가지 분류 기가 있습니다. 낮은 범위의 임계 값에서 더 나은 성능을 제공하는 분류기 A 더 높은 범위의 임계 값에서 더 나은 성능을 제공하는 분류기 B 분류기 C p-coin을 뒤집고 두 분류기에서 선택하여 얻는 …

2
시계열 및 이상 탐지
시계열의 이상을 탐지하기위한 알고리즘을 설정하고 싶습니다.이를 위해 클러스터링을 사용할 계획입니다. 원시 시계열 데이터가 아닌 클러스터링에 거리 매트릭스를 사용해야하는 이유는 무엇입니까?, 이상을 탐지하기 위해 DBscan과 같은 알고리즘 인 밀도 기반 클러스터링을 사용할 것이므로이 경우에도 효과가 있습니까? 스트리밍 데이터 용 온라인 버전이 있습니까? 이상이 발생하기 전에 이상을 감지하고 싶습니다. ARIMA (추세 감지 …

3
R을 사용하여 감소를 시각화하는 가장 좋은 방법은 무엇입니까?
이 사이트를 통해 최근에 Sankey Diagrams를 발견했습니다. Sankey Diagrams는 전통적인 순서도 에서 일어나는 일을 시각화하는 좋은 방법 입니다. 다음은 George M. Whitesides와 George W. Crabtree ( Source) 의 Sankey Diagram의 좋은 예입니다 . 2007 년 2 월 9 일, 과학에 관한 장기 기본 연구를 잊지 마십시오 : Vol. 315. 아니오 …

2
“부트 스트랩 유효성 검사”(일명“리샘플링 교차 유효성 검사”) 절차는 무엇입니까?
"부트 스트랩 유효성 검사"/ "리샘플링 교차 유효성 검사"는 처음이지만 이 질문 에 대한 답변으로 논의되었습니다 . 시뮬레이션 데이터의 크기가 실제 데이터와 동일한 크기가 될 때까지 대체로 리샘플링하여 주어진 시뮬레이션 데이터 세트가 실제 데이터에서 생성되는 실제 데이터와 시뮬레이션 데이터의 두 가지 유형의 데이터를 수집합니다. 이러한 데이터 유형을 사용하는 두 가지 접근법을 …

2
비선형 모델로 그룹화 변수의 효과를 테스트하는 방법은 무엇입니까?
비선형 모델에서 그룹화 변수 사용에 관한 질문이 있습니다. nls () 함수는 요인 변수를 허용하지 않기 때문에 모형 적합에 대한 요인의 영향을 테스트 할 수 있는지 알아 내기 위해 고심하고 있습니다. 아래에는 "계절 화 된 폰 베르 탈란 피"성장 모델을 다양한 성장 처리 (가장 일반적으로 어류 성장에 적용)에 맞추려는 예가 포함되어 …
15 r  mixed-model  nls 

1
기능적 데이터 분석을 언제 / 어디서 사용합니까?
나는 매우 기능적인 데이터 분석 (FDA)의 새로운. 내가 읽고있다: Ramsay, James O. 및 Silverman, Bernard W. (2006), Functional Spring Analysis, 2nd ed., Springer, New York. 그러나 FDA가 언제 어디에서 언제 사용해야하는지 잘 모르겠습니다. 누군가가 특히 의학 연구에서 예를 들어 주시겠습니까? 실제로 FDA를 어디에 / 언제 적용해야하는지 모르겠습니다. 성장 곡선 데이터의 …

4
시계열의 통계적으로 유의미한 차이를 테스트합니까?
같은 기간 동안 두 유가 증권 A와 B의 시계열을 같은 기간에 걸쳐 같은 빈도로 샘플링했습니다. 두 가격 사이에 시간이 지남에 따라 통계적으로 유의 한 차이가 있는지 테스트하고 싶습니다 (내 귀무 가설은 그 차이가 null이라는 것입니다). 특히, 가격 차이를 시장 효율성의 대리자로 사용하고 있습니다. A와 B가 유가 증권과 그에 상응하는 합성 …

2
다른 조정
나는 다음과 같이 제안 된 조정 R- 제곱 공식을 염두에 두었다. 에스겔 (1930 년)은 현재 SPSS에서 사용되는 것으로 생각합니다. R2adjusted=1−(N−1)(N−p−1)(1−R2)Radjusted2=1−(N−1)(N−p−1)(1−R2)R^2_{\rm adjusted} = 1 - \frac{(N-1)}{(N-p-1)} (1-R^2) 올킨과 프랫 (1958) R2unbiased=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)Runbiased2=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)R^2_{\rm unbiased} = 1 - \frac{(N-3)(1-R^2)}{(N-p-1)} - \frac{2(N-3)(1-R^2)^2}{(N-p-1)(N-p+1)} 어떤 상황에서 (있는 경우) '편향되지 않은' '조정 된'을 선호해야 합니까?R2R2R^2 참고 문헌 에스겔, …

3
R에서 데이터 프레임을 확장하는 방법
잠김 . 이 질문과 답변은 잠겨 있습니다 주제는 주제가 다르지만 역사적 의미가 있기 때문에이 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. R로 일부 분석을 수행하는 동안 다음과 같은 문제가 있습니다. 다음과 같은 데이터 프레임이 있습니다. Name | Group | Count Person 1 | A | 3 Person 2 | A …
15 r 

1
황토 적합을 위해 R 제곱을 얻는 방법?
R 및 / 또는 함수 출력의 R 제곱 ( ) 통계량 을 계산하는 방법은 무엇입니까? 이 데이터의 예를 들면 다음과 같습니다.아르 자형2아르 자형2r^2loesspredict cars.lo <- loess(dist ~ speed, cars) cars.lp <- predict(cars.lo, data.frame(speed = seq(5, 30, 1)), se = TRUE) cars.lpfit모형과 se.fit표준 오차에 대한 두 개의 배열 이 있습니다 .
15 r  r-squared  loess 

1
추정기 표기법 (물결 대 모자)
1. 통계에서 모자와 물결표 기호에 관한 명명 규칙이 있습니까? 내가 발견 β가 에 대한 추정을 설명한다 ( 위키 백과 ) 그러나 나는 또한 발견 에 대한 추정을 설명한다 ( 볼프람 ). 의미에 차이가 있습니까? 웹에서 나는 약간의 차이점을 발견했지만 Stats Symbols에 대한 Reference 의 의미가 확실하지 않습니다 . "모수 추정치"와 …
15 notation 

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.