통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A


2
혼합 모델에서 단일 맞춤 처리
모델이 있다고 가정 해 봅시다. mod <- Y ~ X*Condition + (X*Condition|subject) # Y = logit variable # X = continuous variable # Condition = values A and B, dummy coded; the design is repeated # so all participants go through both Conditions # subject = random effects for different …


2
Adam Optimizer를 사용한 훈련 손실 및 반복에서의 스파이크 설명
i) SGD 및 ii) Adam Optimizer를 사용하여 신경망을 훈련하고 있습니다. 정상적인 SGD를 사용할 때 아래 (빨간색)와 같이 부드러운 훈련 손실 대 반복 곡선이 나타납니다. 그러나 Adam Optimizer를 사용할 때 훈련 손실 곡선에 약간의 급상승이 있습니다. 이 스파이크에 대한 설명은 무엇입니까? 모형 세부 사항 : 14 개의 입력 노드-> 2 개의 …

2
정규 분포의 두 번째 모수는 분산 또는 표준 편차입니까?
때로는 교과서가 정규 분포의 두 번째 매개 변수를 표준 편차 및 분산으로 참조하는 것을 보았습니다. 예를 들어, 랜덤 변수 X ~ N (0, 4)입니다. 시그마 또는 시그마 제곱이 4인지 여부는 확실하지 않습니다. 표준 편차 나 분산이 지정되지 않은 경우 사용되는 일반적인 규칙을 찾으려고합니다.

1
분류기 대 모델 대 추정기
분류기, 모델 및 추정기의 차이점은 무엇입니까? 내가 말할 수있는 것에서 : 추정기는 회귀 알고리즘에서 찾은 예측 변수입니다. 분류기는 분류 알고리즘에서 찾은 예측 변수입니다. 모델은 추정자 또는 분류 자일 수 있습니다. 그러나 온라인에서 볼 때 이러한 정의가 섞여있을 수 있습니다. 그렇다면 기계 학습과 관련하여 진정한 정의는 무엇입니까?

2
수축이 실제로 작동하는 이유는 무엇입니까? 0에 대해 특별한 점은 무엇입니까?
이 사이트에는 이미 같은 문제에 대한 게시물이 있습니다. 왜 수축이 작동합니까? 그러나 답변이 인기가 있지만 질문의 요지가 실제로 해결되지 않았다고 생각합니다. 추정에 약간의 편향을 도입하면 분산이 감소하고 추정 품질이 향상 될 수 있음이 분명합니다. 하나: 1) 왜 편향 도입으로 인한 피해가 분산 이득과 비교하여 적습니까? 2) 왜 항상 작동합니까? 예를 …

2
한계 분포 / 마진 확률이 왜“마진”으로 설명 되는가?
한계는 일반적으로 작은 효과, 더 큰 시스템의 외부에있는 것을 말합니다. 그것은 "마진 적"이라고 묘사 된 것의 중요성을 감소시키는 경향이 있습니다. 그렇다면 랜덤 변수의 하위 집합 확률에 어떻게 적용됩니까? 단어의 의미로 인해 단어가 수학에서 위험한 제안이 될 수 있다고 가정 할 때 여기에 반드시 답이있는 것은 아니라는 것을 알고 있지만 때로는 …


2
기차가 오기 전에 시간을 모델링하는 데 사용할 분포는 무엇입니까?
기차 도착 시간에 대한 일부 데이터를 모델링하려고합니다. "기다리는 시간이 길수록 열차가 나타날 가능성이 높다"는 내용 의 배포판을 사용하고 싶습니다 . P (train show up | 60 분 기다림)가 1에 가까워 지도록 그러한 분포가 CDF처럼 보일 것 같습니다. 여기서 사용하기에 적합한 분포는 무엇입니까?

7
백분율 데이터에 어떤 종류의 곡선 (또는 모형)을 적용해야합니까?
바이러스 사본과 게놈 범위 (GCC) 간의 관계를 보여주는 그림을 만들려고합니다. 이것은 내 데이터의 모습입니다 : 처음에는 선형 회귀를 플로팅했지만 관리자가 잘못되었다고 말하고 시그 모이 드 곡선을 시도한다고 말했습니다. 그래서 geom_smooth를 사용 하여이 작업을 수행했습니다. library(scales) ggplot(scatter_plot_new, aes(x = Copies_per_uL, y = Genome_cov, colour = Virus)) + geom_point() + scale_x_continuous(trans = …

3
Quantile 회귀에 비해 선형 회귀의 장점은 무엇입니까?
선형 회귀 모델은 가정의 무리하게 분위수 회귀는 선형 회귀의 가정이 충족되는 경우, 다음 내 직감 (그리고 매우 제한된 경험) 평균 회귀 선형 회귀 거의 동일한 결과를 얻을 것입니다하지 않습니다. 선형 회귀는 어떤 장점이 있습니까? 확실히 더 친숙하지만 그 이외의 것입니까?

2
GLM의 과대 산포 테스트는 실제로 * 유용 *합니까?
응답 변수의 분산을 제한하는 모델을 사용할 때마다 GLM에서 '과도 분산'현상이 발생하며 데이터는 모델 제한이 허용하는 것보다 큰 분산을 나타냅니다. 이것은 Poisson GLM을 사용하여 카운트 데이터를 모델링 할 때 일반적으로 발생하며 잘 알려진 테스트로 진단 할 수 있습니다. 검정 결과 과대 산포의 통계적으로 유의미한 증거가있는 경우, 분산 모형을 사용하여 원래 모형에서 …


2
계산 통계에서 난수 생성의 중요한 용도는 무엇입니까?
계산 통계에서 난수 생성기 (RNG)가 어떻게 그리고 왜 중요합니까? 나는 어느 가설에 대한 편견을 피하기 위해 많은 통계 테스트를 위해 샘플을 선택할 때 무작위성이 중요하다는 것을 이해하지만 난수 생성기가 중요한 다른 계산 통계 영역이 있습니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.