통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
그래픽 유형 II (베타) 오류, 검정력 및 표본 크기를 가장 잘 표시하는 방법은 무엇입니까?
통계에 대한 소개를 작성하라는 요청을 받았으며 p- 값과 전력의 관계를 그래픽으로 표시하는 방법을 고심하고 있습니다. 이 그래프를 생각해 냈습니다. 내 질문 : 이것을 표시하는 더 좋은 방법이 있습니까? 여기 내 R 코드가 있습니다 x <- seq(-4, 4, length=1000) hx <- dnorm(x, mean=0, sd=1) plot(x, hx, type="n", xlim=c(-4, 8), ylim=c(0, 0.5), …
16 r  teaching  power 

2
R의 nls ()를 사용한 변화 점 분석
"change point"분석 또는 nls()R에서 다상 회귀 분석을 구현하려고합니다 . 여기 내가 만든 가짜 데이터가 있습니다. 데이터를 맞추기 위해 사용하려는 공식은 다음과 같습니다. 와이= β0+ β1x + β2최대 ( 0 , x − δ)와이=β0+β1엑스+β2최대(0,엑스−δ)y = \beta_0 + \beta_1x + \beta_2\max(0,x-\delta) 이것이해야 할 일은 특정 절편과 기울기 ( β0β0\beta_0 및 β1β1\beta_1 ) …

1
기초 과학의 순차 가설 검정
나는 약리학 자이며, 내 경험상, 기본 생물 의학 연구의 거의 모든 논문은 Student 's t-test를 사용합니다 (추론을 뒷받침하거나 기대에 부응하기 위해 ...). 몇 년 전, 학생의 t- 검정은 가장 효율적인 시험이 아니라는 점에 주목했습니다. 순차 시험은 모든 표본 크기에 대해 더 많은 검정력을 제공하거나 동등한 검정력에 대해 평균적으로 훨씬 작은 …

2
브라운 다리의 최상부에 왜 콜로 모고 로프-스 미르 노프 분포가 있는가?
Kolmogorov–Smirnov 분포는 Kolmogorov–Smirnov 검정 에서 알려져 있습니다 . 그러나 그것은 또한 브라운 다리의 최고의 분포입니다. 이것은 나에게 명백하지 않기 때문에,이 우연의 일치에 대한 직관적 인 설명을 부탁드립니다. 참조도 환영합니다.

3
재무 시계열에서 강력한 이상치 탐지
재무 시계열 데이터 (예 : tickdata)에서 특이 치 및 오류 (원인이 무엇이든)를 제거 할 수있는 강력한 기술을 찾고 있습니다. 틱별로 금융 시계열 데이터는 매우 지저분합니다. 교환이 닫히면 엄청난 시간 간격이 생기고 교환이 다시 열리면 크게 점프합니다. 거래소가 열리면 모든 종류의 요소가 잘못되었거나 발생하지 않은 가격 수준 또는 시장을 대표하지 않는 …

2
Freedman 등의 "통계"와 Freedman의 "통계 모델 : 이론 및 실습"중에서 선택
통계학자는 아니지만 통계에 관심이 많으며 참고할만한 책을 사고 싶습니다. 특정 주제에 대한 몇 권의 책이 있습니다 (예 : 머신 러닝을 위한 통계 학습의 요소 또는 베이지안 데이터 분석). 대한 Bayesian Data Analysis : ...), 더 일반적인 책을 찾고있었습니다. Freedman의 책은 종종 여기에서 잘 고려됩니다. 고급 통계 책 추천 비 통계 …
16 references 

4
왜 P (A, B | C) / P (B | C) = P (A | B, C)입니까?
내가 이해P(A∩B)/P(B)=P(A|B)P(A∩B)/P(B)=P(A|B)P(A\cap B)/P(B) = P(A|B) . 조건은 A와 B의 교차점을 B의 전체 영역으로 나눈 것입니다. 그러나 왜 P(A∩B|C)/P(B|C)=P(A|B∩C)P(A∩B|C)/P(B|C)=P(A|B∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) 인가? 직감을 줄 수 있습니까? 그것은해야하지 : P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A∩B∩C)/P(B,C)=P(A|B∩C)P(A\cap B \cap C)/P(B,C) = P(A|B \cap C) ?


2
랜덤 효과와 함께 서수 로지스틱 회귀를 사용하는 방법은 무엇입니까?
내 연구에서는 몇 가지 메트릭으로 작업 부하를 측정 할 것입니다. 심박 변이 (HRV), 전극 활동 (EDA) 및 주관적 척도 (IWS). 정규화 후 IWS에는 세 가지 값이 있습니다. 정상보다 낮은 작업량 작업량은 평균입니다 작업량이 정상보다 높습니다. 생리적 측정이 주관적 워크로드를 얼마나 잘 예측할 수 있는지 알고 싶습니다. 따라서 비율 데이터를 사용하여 …

1
코사인 유사성, 피어슨 상관 관계 및 z- 점수간에 관계가 있습니까?
이 세 가지 측정 값 사이에 어떤 관계가 있는지 궁금합니다. 나는 정의를 참조하여 그들 사이를 연결할 수없는 것 같습니다 (아마도 이러한 정의에 익숙하지 않고 이해하는 데 약간의 시간이 걸리기 때문일 수 있습니다). 코사인 유사성의 범위는 0-1 일 수 있으며 피어슨 상관 관계는 -1에서 1 사이 일 수 있으며 z 점수 …

2
회귀에 대한 자연 큐빅 스플라인 정의
Hastie et al.의 "통계 학습 데이터 마이닝, 추론 및 예측의 요소"책에서 스플라인에 대해 배우고 있습니다. 145 페이지에서 자연 입방 스플라인이 경계 매듭 너머에 선형이라는 것을 알았습니다. 있습니다 매듭, ξ 1 , ξ 2 , . . . 스플라인의 ξ K 및 다음은이 스플라인의 스플라인에 대한 것입니다.KKKξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, \xi_2, ... \xi_K 질문 …

1
컨볼 루션 네트워크에서 컨볼 루션 필터 수의 중요성은 무엇입니까?
회선 레이어의 필터 수는 무엇을 전달합니까? 이 수치는 아키텍처의 성능 또는 품질에 어떤 영향을 미칩니 까? 항상 더 많은 수의 필터를 선택해야합니까? 무엇이 좋은가요? 그리고 사람들은 어떻게 다른 레이어에 다른 수의 필터를 할당합니까? 나는이 질문을보고 의미 : CNN에서 회선 연산자의 수를 결정하는 방법? 대답은 필터와 크기가 다른 3 개의 회선 …

2
신뢰 구간 해석
참고 : 중복 된 경우 사전에 사과드립니다. 검색에서 비슷한 q를 찾지 못했습니다. 우리가 진정한 매개 변수 p를 가지고 있다고 가정 해보십시오. 신뢰 구간 C (X)는 p의 95 %를 포함하는 RV입니다. 이제 X를 관찰하고 C (X)를 계산한다고 가정하자. 일반적인 대답은 "p를 포함하거나 포함하지 않기"때문에 "p를 포함 할 확률이 95 %"인 것으로 …

3
우리는 언제 공선 성을 말할 수 있습니까?
선형 모델에서는 설명 변수 사이에 관계가 있는지 확인해야합니다. 이들이 너무 많은 상관 관계가 있으면 공선 성이 존재합니다 (즉, 변수가 서로를 부분적으로 설명합니다). 나는 현재 각 설명 변수 사이의 쌍별 상관 관계를보고 있습니다. 질문 1 : 상관 관계가 너무 많은 분류는 무엇입니까? 예를 들어 피어슨 상관 관계가 0.5로 너무 큽니까? 질문 …

3
중첩 된 var-covar 모델 중에서 선택하기 위해 ML 대신 REML을 사용해야하는 이유는 무엇입니까?
선형 혼합 모형의 임의 효과에 대한 모형 선택에 대한 다양한 설명은 REML을 사용하도록 지시합니다. 일부 수준에서 REML과 ML의 차이점을 알고 있지만 ML이 바이어스되어 REML을 사용해야하는 이유를 이해하지 못합니다. 예를 들어 ML을 사용하여 정규 분포 모형의 분산 모수에 대해 LRT를 수행하는 것이 잘못 되었습니까 (아래 코드 참조)? 모델 선택에서 ML보다 편견이 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.