통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
왜 ln [E (x)]> E [ln (x)]입니까?
우리는 재정 과정에서 로그 정규 분포를 다루고 있으며 교과서는 이것이 사실이라고 말합니다. 수학 배경이 매우 강하지는 않지만 직감이 필요하기 때문에 다소 실망 스럽습니다. 왜 이런 경우인지 나에게 보여줄 수 있습니까?

1
복합 대칭 인 경우 (0 + factor) 및 (1 | group) + (1 | group : factor) 랜덤 효과 사양의 동등성
Douglas Bates는 다음 모델이 "벡터 값 랜덤 효과에 대한 분산 공분산 행렬에 복합 대칭이라는 특수한 형태가있는 경우"( 이 프레젠테이션의 슬라이드 91)에 해당 한다고 설명 합니다. m1 <- lmer(y ~ factor + (0 + factor|group), data) m2 <- lmer(y ~ factor + (1|group) + (1|group:factor), data) 특히 Bates는이 예제를 사용합니다. library(lme4) …

3
데이터 크기가 거대 할 때 회귀 분석에서 통계적 유의성은 어떻게 되었습니까?
whuber 가 다음과 같이 흥미로운 점을 지적한 대규모 회귀 ( link ) 에 관한이 질문을 읽었습니다 . "거의 모든 통계 테스트는 너무 강력하여"유의 한 "효과를 거의 확실하게 확인할 수 있습니다. 유의성보다는 효과 크기와 같은 통계적 중요성에 더 집중해야합니다." --- 우버 이것이 입증 될 수있는 것이거나 실제로 어떤 일반적인 현상인지 궁금합니다. …


2
최적화 및 머신 러닝
기계 학습에 얼마나 많은 최적화가 필요한지 알고 싶었습니다. 내가 들었던 것에서 통계는 기계 학습을하는 사람들에게 중요한 수학적 주제입니다. 기계 학습을하는 사람이 볼록 또는 비 볼록 최적화에 대해 배우는 것이 얼마나 중요합니까?

1
iloc을 사용하여 값 설정 [닫기]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 2 년 전 . 이 줄은 dataframe에서 처음 4 개 행을 반환 combined에 대한feature_a combined.iloc[0:4]["feature_a"] 예상 한대로이 다음 행은 열의 데이터 프레임에서 두 번째, 네 번째 및 …
13 python  pandas 

2
이항의 분산을 이해하지 못합니다
나는 그런 기본적인 질문을하는 것조차도 바보처럼 느껴지지만 여기에 간다. 나는 확률 변수의 경우 값을 취할 수 과 로, 와 , 그럼 내가 그리는 경우 그것의 샘플을, 나는거야 이항 분포.XXX000111P(X=1)=pP(X=1)=pP(X=1) = pP(X=0)=1−pP(X=0)=1−pP(X=0) = 1-pnnn 분포의 평균은 μ=np=E(X)μ=np=E(X)\mu = np = E(X) 분포의 분산은 σ2=np(1−p)σ2=np(1−p)\sigma^2 = np(1-p) 여기 내 문제가 시작됩니다 : …

8
설문 조사 : 대규모 사용자 기반의 25 %가 대표입니까?
내 고용주는 현재 사무실에 대한 태도, 즉 감정에 대한 회사 차원의 설문 조사를 진행하고 있습니다. 과거에는 비즈니스의 모든 영역 (10 개의 매우 다른 부서로 가정)과 그 내부의 모든 직원에 대해 설문 조사를 열었습니다 (회사 전체에서 총 1000 명으로 가정) 각 부서의 직원 수는 같지 않으며 1 명 특정 부서는 전체 …

1
경우 고정되어있다 반드시 고정?
라면 는 정지 iff 라는 ARCH 모델의 속성 중 하나에 대한 증거를 여기서 ARCH 모델은 다음과 같습니다.{ X t } ∑ p i = 1 b i &lt; 1E(X2t)&lt;∞E(Xt2)&lt;∞\mathbb{E}(X_t^2) < \infty{Xt}{Xt}\{X_t\}∑pi=1bi&lt;1∑i=1pbi&lt;1\sum_{i=1}^pb_i < 1 Xt=σtϵtXt=σtϵtX_t = \sigma_t\epsilon_t σ2t=b0+b1X2t−1+...bpX2t−pσt2=b0+b1Xt−12+...bpXt−p2\sigma_t^2 = b_0 + b_1X_{t-1}^2 + ... b_pX_{t-p}^2 증명의 주요 아이디어는 가 AR (p) …

4
Norms- 특별한 점은 무엇입니까 ?
때문에 규범 (적어도 부분적으로) 고유 아닌 볼록 볼록 사이의 경계에있다. 규범은 '대부분의 스파 스'볼록 규범 (오른쪽?). p = 1 L 1L1L1L_1p=1p=1p=1L1L1L_1 나는 이해 유클리드 규범 기하학에 뿌리를 가지고 있으며, 크기가 같은 단위가 때 명확한 해석이있다. 그러나 왜 다른 실수보다 우선적으로 사용되는지 이해하지 못합니다 : ? ? 왜 전체 연속 범위를 …

3
베타 배포는 언제입니까?
여기에있는 모든 사람들이 이미 알고 있듯이 베타 배포판 의 PDF는 다음과 같이 제공됩니다.X∼B(a,b)X∼B(a,b)X \sim B(a,b) f(x)=1B(a,b)xa−1(1−x)b−1f(x)=1B(a,b)xa−1(1−x)b−1f(x) = \frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1} 나는이 공식의 기원에 대한 설명을 위해 온통 사냥을 해왔지만 찾을 수는 없습니다. 베타 배포판에서 찾은 모든 기사는이 수식을 제공하고 몇 가지 모양을 보여준 다음 순간에 대해 논의하는 것으로 계속 진행됩니다. 나는 파생하고 …

4
비선형 모델을 사용할 때 다중 공선성에 대해 걱정해야합니까?
대부분 범주 형 기능에 이진 분류 문제가 있다고 가정합니다. 비선형 모델 (예 : XGBoost 또는 Random Forests)을 사용하여 학습합니다. 여전히 다중 공선성에 대해 걱정해야합니까? 왜? 위의 답변이 사실이라면, 이러한 유형의 비선형 모델을 사용하고 있다는 점을 고려하여 어떻게 싸워야합니까?


2
신경망 : 원-핫 변수 압도적 인 연속?
약 20 열 (20 가지 기능)이있는 원시 데이터가 있습니다. 그 중 10 개는 연속적인 데이터이고 10 개는 범주 형입니다. 범주 형 데이터 중 일부는 50 개의 서로 다른 값 (미국)을 가질 수 있습니다. 데이터를 사전 처리 한 후 10 개의 연속 열이 10 개의 준비된 열이되고 10 개의 범주 형 …

1
심층 강화 학습이 불안정한 이유는 무엇입니까?
DeepMind의 심층 강화 학습에 관한 2015 년 논문에서 "안정적인 학습으로 인해 RL과 신경망을 결합하려는 이전의 시도는 크게 실패했습니다"라고 말합니다. 그런 다음이 논문은 관측에 대한 상관 관계를 기반으로이 문제의 원인을 나열합니다. 누군가 이것이 이것이 무엇을 의미하는지 설명해 주시겠습니까? 신경망이 훈련에는 있지만 시험에는 없을 수있는 일부 구조를 학습하는 과적 합의 형태입니까? 아니면 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.