통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
인과 추론에 대한 인과 철학에 대한 온라인 리소스
역학 / 생물 통계학자가 인과 / 인과 적 추론의 철학에 대해 흥미롭고 유용 할 수있는 책, 기사, 에세이, 온라인 자습서 / 강좌 등을 추천 할 수 있습니까? 나는 실제로 epi와 biostats 프레임 워크에서 인과 적 추론을하는 것에 대해 꽤 알고 있지만,이 연구의 기초가되고 동기를 부여하는 철학에 대해 배우고 싶습니다. 예를 …

2
일별 시계열 데이터에서 월별 효과를 모델링하는 방법은 무엇입니까?
매일 두 개의 시계열 데이터가 있습니다. 하나는 구독 sign-ups이고 다른 하나는 terminations구독입니다. 두 변수에 포함 된 정보를 사용하여 후자를 예측하고 싶습니다. 이 시리즈의 그래프를 보면 해지가 몇 달 전에 여러 번 가입 한 것과 관련이 있음이 분명합니다. 즉, 5 월 10 일에 가입이 급증하면 6 월 10 일, 7 월 …

3
위험률, 확률 밀도, 생존 함수 간의 관계 증명
나는 생존 분석에 대해 조금 읽고 있으며 대부분의 교과서에는 h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)= \lim_{ \Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t |T \geq t )}{ \Delta t} =\frac{f(t)}{1-F(t)} (1) 여기서 h(t)h(t)h(t) 는 위험률이며 f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=\lim_{\Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t)}{ \Delta t}(2) 밀도 함수, F(t)=Pr(T&lt;t)(3)F(t)=Pr(T&lt;t)(3)F(t)=Pr(Tt)=1-F(t) (4) 또한 …
11 survival 

1
커널 릿지 회귀 효율
릿지 회귀는 여기서 는 예측 된 레이블입니다. , , 매트릭스를 식별 우리가 레이블을 찾기 위해 노력하고있는 객체와 의 매트릭스 객체 :y^=(X′X+aId)−1Xxy^=(X′X+aId)−1Xx\hat{y} = (\mathbf{X'X} + a\mathbf{I}_d)^{-1}\mathbf{X}xy^y^\hat{y}IdId\mathbf{I}_dd×dd×dd \times dxx\mathbf{x}XX\mathbf{X}n×dn×dn \times dnnnxi=(xi,1,...,xi,d)∈Rdxi=(xi,1,...,xi,d)∈Rd\mathbf{x}_i = (x_{i,1}, ..., x_{i,d})\in \mathbb{R}^d X=⎛⎝⎜⎜⎜⎜⎜x1,1x2,1⋮xn,1x1,2x2,2⋮x1,2……⋱…x1,dx2,d⋮xn,d⎞⎠⎟⎟⎟⎟⎟X=(x1,1x1,2…x1,dx2,1x2,2…x2,d⋮⋮⋱⋮xn,1x1,2…xn,d) \mathbf{X} = \begin{pmatrix} x_{1,1} & x_{1,2} & \ldots & x_{1,d}\\ x_{2,1} & x_{2,2} & \ldots …

3
PCA, ICA 및 라플라시안 고유 맵
질문 나는 Laplacian Eigenmaps 방법에 매우 관심이 있습니다. 현재 의료 데이터 세트에서 치수를 줄이는 데 사용하고 있습니다. 그러나 방법을 사용하여 문제가 발생했습니다. 예를 들어, 일부 데이터 (스펙트럼 신호)가 있고 PCA (또는 ICA)를 사용하여 일부 PC (또는 IC)를 가져올 수 있습니다. 문제는 LE를 사용하여 원본 데이터의 유사한 차원 축소 구성 요소를 …
11 pca  ica 

4
데이터에서 인과 관계를 어떻게 찾습니까?
열 "A", "B"가있는 테이블이 있다고 가정하겠습니다. "A"로 인해 "B"가 발생하는지 확인하는 통계적 방법이 있습니까? 피어슨의 r을 실제로 사용할 수는 없습니다. 값 간의 상관 관계 만 테스트합니다. 상관 관계가 원인이 아님 Pearson의 r은 선형 관계 만 상관시킬 수 있습니다 그래서 여기에 다른 옵션이 있습니까?

3
R에서 자동 상관 난수 생성
우리는 시계열로 사용될 자동 상관 난수 값을 만들려고 노력하고 있습니다. 참조하는 기존 데이터가 없으며 벡터를 처음부터 새로 작성하려고합니다. 한편으로 우리는 물론 배포와 SD를 가진 임의의 프로세스가 필요합니다. 다른 한편으로, 랜덤 프로세스에 영향을 미치는 자기 상관이 설명되어야한다. 벡터의 값은 여러 시간 지연에 따른 강도 감소와 자동 상관됩니다. 예를 들어 lag1은 0.5, …

1
R의 피셔 테스트
다음과 같은 데이터 세트가 있다고 가정하십시오. Men Women Dieting 10 30 Non-dieting 5 60 R에서 Fisher 정확한 테스트를 실행하면 무엇을 alternative = greater의미합니까? 예를 들면 다음과 같습니다. mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") 내가 얻을 p-value = 0.01588하고 odds ratio = 3.943534. 또한 우발 사태 테이블의 행을 다음과 같이 뒤집을 …

2
그룹화 된 데이터의 임의 포리스트
계층 적 구조를 갖는 고차원 그룹화 된 데이터 (50 개의 숫자 입력 변수)에 임의 포리스트를 사용하고 있습니다. 70 개의 서로 다른 개체의 30 개 위치에서 6 개의 복제로 데이터를 수집하여 12600 개의 데이터 포인트를 생성했으며, 이는 독립적이지 않습니다. oob 오류는 훈련 중에 하나의 개체에서 데이터를 남기고 훈련 된 임의의 포리스트로 …

5
2 개의 비 정적 시계열을 비교하여 상관 관계를 결정하는 방법은 무엇입니까?
시간이 지남에 따라 평균 연령을 나타내는 두 개의 데이터 시리즈가 있습니다. 두 시리즈 모두 시간이 지남에 따라 사망시 나이가 증가하지만 하나는 다른 것보다 훨씬 낮습니다. 더 낮은 샘플의 사망시 연령 증가가 상위 샘플의 연령 증가와 크게 다른지 확인하고 싶습니다. 다음은 연도별로 (1972 년부터 2009 년까지) 세 개의 소수점 이하 자릿수로 …


1
시변 공변량을 사용하여 종 방향 혼합 모델에서 동시 및 지연 효과 테스트
최근에 이러한 공변량에 대한 시간 지연을 도입하지 않고 시간에 따른 공변량을 종 방향 혼합 모델에 통합 할 수 없다고 들었습니다. 이것을 확인 / 거부 할 수 있습니까? 이 상황에 대한 언급이 있습니까? 나는 명확히 할 간단한 상황을 제안한다. 40 명의 피험자에서 정량적 변수 (y, x1, x2, x3)의 측정 (30 회 …

4
시계열에 대한 설명은 무엇입니까?
지금까지는 단면 데이터로 대부분 작업했으며 아주 최근에는 브라우징, 수많은 시계열 문헌을 통해 문제를 스캔하여 시계열 분석에서 어떤 역할 설명 변수가 어떤 역할을하는지 궁금합니다. 디트 렌딩 대신 트렌드 를 설명하고 싶습니다 . 제가 소개로 읽은 내용의 대부분은이 시리즈가 확률 론적 과정에서 나온 것이라고 가정합니다. AR (p) 및 MA 프로세스와 ARIMA 모델링에 …

6
시리즈에서 데이터 포인트 수를 줄이려면 어떻게합니까?
나는 10 년 이상 통계를 공부하지 않았으며 (그리고 기본 코스), 내 질문은 이해하기 어려울 것입니다. 어쨌든, 내가하고 싶은 일은 일련의 데이터 포인트 수를 줄이는 것입니다. x 축은 측정 시작 이후 밀리 초 수이며 y 축은 해당 지점의 판독 값입니다. 종종 수천 개의 데이터 포인트가 있지만 수백 개만 필요할 수도 있습니다. …

1
U- 매트릭스를 자동으로 클러스터링하는 방법?
자체 구성 맵을 학습 한 후 U- 매트릭스를 계산할 수 있습니다 . 있다 몇 가지 도구 를 수동으로 시각화하고 클러스터를 식별 할 수는 있지만, (즉, 클러스터를 식별하기 위해 그림을보고 인간을 가지고 있지) 자동 방법으로이 과정을 할 수있는 알고리즘이 있는지 궁금 하군요. 이것을 할 수있는 방법이 있습니까? R로 코드를 작성하고 있습니다. …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.