통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


4
여러 그룹의 평균을 비교하는 분산 분석과 중첩 모델을 비교하는 분산 분석의 관계는 무엇입니까?
지금까지 ANOVA가 두 가지 방식으로 사용되는 것을 보았습니다. 먼저 , 나의 입문 통계 텍스트에서, ANOVA는 평균 중 하나가 통계적으로 유의 한 차이가 있는지를 결정하기 위해 쌍별 비교에 대한 개선으로 3 개 이상의 그룹의 평균을 비교하는 방법으로 도입되었습니다. 둘째 , 통계 학습 텍스트에서 ANOVA는 모델 2 예측 변수의 하위 집합을 사용하는 …

5
동일한 분포 패밀리의 두 랜덤 변수가 동일한 기대치와 분산을 갖지만 더 높은 모멘트를 가질 수 있습니까?
나는 위치 규모 가족의 의미에 대해 생각하고있었습니다. 내 이해는 매개 변수 와 스케일을 가진 위치 스케일 패밀리의 모든 멤버에 대해 의 분포는 매개 변수에 의존하지 않으며 해당 패밀리에 속하는 모든 에 대해 동일 하다는 것입니다.a b Z = ( X − a ) / b XXXXaaabbbZ=(X−a)/bZ=(X−a)/bZ =(X-a)/bXXX 그래서 내 질문은 …

2
가중치보다 적은 훈련 샘플로 (이론적으로) 신경망을 훈련시킬 수 있습니까?
우선, 신경망을 훈련시키는 데 필요한 샘플 크기는 일반적으로 없습니다. 그것은 작업의 복잡성, 데이터의 노이즈 등과 같은 너무 많은 요소에 달려 있습니다. 훈련 샘플이 많을수록 네트워크가 더 좋습니다. 그러나 궁금한 점이있다 : 만약 내가 "단순"하다고 생각한다면 이론적으로 가중치보다 적은 훈련 샘플로 신경망을 훈련시키는 것이 가능한가? 아무도 이것이 잘 된 예를 알고 …

3
one-hot 인코딩이 필요한 알고리즘은 무엇입니까?
순서가없는 범주 형 변수에 원 핫 인코딩을 사용해야 할 때와 사용하지 않을 때는 확실 하지 않습니다. 알고리즘이 거리 메트릭을 사용하여 유사성을 계산할 때마다 사용합니다. 순서가없는 범주 형 기능이 핫 인코딩 된 유형과 어떤 유형의 알고리즘이 아닌 알고리즘 유형에 대한 일반적인 경험을 가진 사람이 있습니까?

1
변형 추론, KL 발산에는 실제 가 필요합니다.
변동 추론에 대한 나의 (매우 겸손한) 이해 를 위해, 다음을 최적화 하는 분포 를 찾아서 미지의 분포 를 근사하려고합니다 .pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} 변형 추론을 이해하는 데 시간을 투자 할 때마다이 공식에 계속 도달하고 도움이 될 수는 없지만 요점을 놓친 것 같습니다. 을 계산하려면 를 알아야 …

1
t-SNE가 클래스를 잘 분리한다는 것을 알면 어떤 분류 알고리즘을 사용해야합니까?
분류 문제가 있다고 가정하고 처음에는 데이터에서 통찰력을 얻고 t-SNE를 수행한다고 가정 해 봅시다. t-SNE의 결과는 클래스를 잘 분리합니다. 이것은 클래스를 아주 잘 분리하는 분류 모델을 만들 수 있음을 의미합니다 (t-SNE가 잘 분리되지 않으면 많은 것을 암시하지 않습니다). t-SNE는 로컬 구조에 중점을두고 클래스를 잘 분리 할 수 ​​있다는 것을 알고 있습니다.이 …

3
배경 : 저는 Ian Goodfellow와 Yoshua Bengio, Aaron Courville의 딥 러닝 6 장을 공부하고 있습니다. 섹션 6.2.2.2 ( 여기에서 볼 수있는 183의 183 페이지 182 )에서 출력 에 시그 모이 드를 사용하는 것이 동기가됩니다.피( y= 1 | x )P(y=1|x)P(y=1|x) 재료를 요약 하기 위해 활성화가 적용되기 전에 출력 뉴런으로 설정합니다. 여기서 …

2
미니 배치 그라디언트 디센트는 배치에서 각 예제의 가중치를 어떻게 업데이트합니까?
일괄 처리로 10 개의 예를 처리하는 경우 각 예의 손실을 합산 할 수 있지만 각 예의 가중치 업데이트와 관련하여 역전 파는 어떻게 작동합니까? 예를 들면 다음과 같습니다. 예 1-> 손실 = 2 예 2-> 손실 = -2 결과적으로 평균 손실은 0 (E = 0)이되므로 각 가중치와 수렴을 어떻게 업데이트합니까? 우리가 …

3
상관 행렬을 계산할 때 결 측값이있는 관측 값을 삭제하는 데 심각한 문제가 있습니까?
2500 개의 변수와 142 개의 관측치가있는이 거대한 데이터 세트가 있습니다. 변수 X와 나머지 변수 사이의 상관 관계를 실행하고 싶습니다. 그러나 많은 열의 경우 누락 된 항목이 있습니다. "pairwise-complete"인수 ( use=pairwise.complete.obs)를 사용하여 R 에서이 작업을 시도 하고 많은 상관 관계를 출력했습니다. 그러나 StackOverflow의 누군가 가이 기사 http://bwlewis.github.io/covar/missing.html 에 대한 링크를 게시 …

2
Keras : val_loss가 증가하는 동안 손실이 감소하는 이유는 무엇입니까?
나는 많은 매개 변수에 대한 그리드 검색을 설정했습니다. 이진 분류를 수행하는 Keras 신경망에 가장 적합한 매개 변수를 찾으려고합니다. 출력은 1 또는 0입니다. 약 200 개의 기능이 있습니다. 그리드 검색을 수행했을 때 많은 모델과 매개 변수를 얻었습니다. 가장 좋은 모델에는 다음과 같은 매개 변수가 있습니다. Epochs : 20 Batch Size : …


1
R의 lm과 biglm이 동일한 데이터에 대해 다른 p- 값을 제공하는 이유는 무엇입니까?
다음은 작은 예입니다. MyDf<-data.frame(x=c(1,2,3,4), y=c(1.2, .7, -.5, -3)) 이제 base::lm: > lm(y~x, data=MyDf) %>% summary Call: lm(formula = y ~ x, data = MyDf) Residuals: 1 2 3 4 -0.47 0.41 0.59 -0.53 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 3.0500 0.8738 3.491 0.0732 . x -1.3800 0.3191 -4.325 …

2
바이어스-분산 방정식의 수학적 직관
I는 최근 질문 질문 : 표본 평균과 분산을 관련된 기본 방정식 뒤에 수학적 해석 / 직관 추구 , 형상 또는 그렇지.E[X2]=Var(X)+(E[X])2E[X2]=Var(X)+(E[X])2 E[X^2] = Var(X) +(E[X])^2 그러나 이제는 표면적으로 유사한 바이어스-분산 트레이드 오프 방정식에 대해 궁금합니다. MSE ( θ)^) = E[ ( θ^− θ )2]==이자형[ ( θ^− E[ θ^] )2] + …
12 variance  bias 


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.