통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
'메시지 전달 방법'이란 무엇입니까?
메시지 전달 방법이 무엇인지 모호합니다. 배포의 각 요인의 근사를 반복적으로 다른 모든 요인의 모든 근사에 따라 작성하여 분포에 대한 근사를 작성하는 알고리즘입니다. 나는 둘 다 Variational Message Passing 과 Expectation Propagation의 예라고 믿는다 . 메시지 전달 알고리즘이보다 명확하고 정확하게 무엇입니까? 참조를 환영합니다.

1
분포 (알고리즘) 대 수학적으로 학습에 대한 장단점은 무엇입니까?
컴퓨터 시뮬레이션을 통해 알고리즘 적으로 수학적으로 분포의 속성을 배우는 장단점은 무엇입니까? 컴퓨터 시뮬레이션은 대안적인 학습 방법이 될 수 있습니다. 특히 미적분학이 강하지 않은 신입생에게는 더욱 그렇습니다. 또한 코딩 시뮬레이션은 분포 개념을 더 빠르고 직관적으로 파악할 수있는 것으로 보입니다.

1
양자화 정규화는 어떻게 작동합니까?
마이크로 어레이를 사용한 유전자 발현 연구에서, 강도 데이터는 정규화되어야 개체간에, 유전자 사이에서 강도를 비교할 수있다. 개념적이고 알고리즘 적으로 "양자 정규화"는 어떻게 작동하며 이것을 비 통계 전문가에게 어떻게 설명 하시겠습니까?

2
두 개의 감마 분포 사이의 쿨백 –Leibler 발산
pdf 의해 감마 분포 를 매개 변수화하도록 선택 와 사이의 Kullback-Leibler 분기 는 다음과 같이 [1]에 의해 주어집니다.Γ(b,c)Γ(비,씨)\Gamma(b,c)g(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b}Γ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)Γ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p) KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqb피\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} \end{align} 나는 같은데요 는 IS 디 감마 …


8
통계를 사용하지 않는 방법
이것은 일종의 개방형 질문이지만 분명하고 싶습니다. 충분한 인구가 있다면 무언가를 배울 수있을 것입니다 (이 부분은 개방 된 부분이지만). 내가 통계에 대해 이해 한 바에 따르면, 그것은 한 집단의 한 구성원에게는 적용 할 수 없지만, 다른 사람이 "나는 전 세계 인구의 10 %가이 질병에 걸렸다"고하는 토론에서 자신을 종종 발견합니다. 방에있는 열 …

1
GSVD는 모든 선형 다변량 기법을 구현합니까?
나는 일반적인 SVD에 관한 Hervé Abdi 의 기사를 보았습니다 . 저자는 언급했다 : 일반화 된 SVD (GSVD)는 직사각형 행렬을 분해하고 행렬의 행과 열에 부과 된 제약 조건을 고려합니다. GSVD는 하위 행렬로 주어진 행렬의 가중 일반화 된 최소 제곱 추정값을 제공하므로, 적절한 제약 조건을 선택하여 GSVD는 모든 선형 다변량 기법 (예 …

2
"혼합 효과 모델링"과 "잠재적 성장 모델링"의 차이점은 무엇입니까?
MEM (혼합 효과 모델)에 익숙하지만 동료가 최근에 LGM (잠재적 성장 모델)과 비교할 수있는 방법을 물었습니다. 나는 약간의 인터넷 검색을했으며 LGM은 적어도 하나의 임의 효과의 각 수준 내에서 반복 된 측정 값을 얻는 환경에 적용되는 구조 방정식 모델링의 변형 인 것처럼 보입니다. 따라서 Time은 모델에서 고정 효과가됩니다. 그렇지 않으면 MEM과 LGM은 …

2
R의 고유 값과 고유 벡터에서 타원을 그리는 방법은 무엇입니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 2 년 전 . 누군가가 마련 수 R의 고유 값으로부터 타원과 같은 행렬의 고유 벡터 플롯 코드 A = ( 2.20.40.42.8)ㅏ=(2.20.40.42.8) \mathbf{A} = \left( \begin{array} {cc} 2.2 …

3
계층 적 군집화에서 Ward의 클러스터 간 연결과 함께 Manhattan 거리를 사용하는 것이 좋습니까?
시계열 데이터를 분석하기 위해 계층 적 클러스터링을 사용하고 있습니다. 내 코드는 Mathematica 함수를 사용하여 구현 DirectAgglomerate[...]되며 다음 입력이 주어지면 계층 적 클러스터를 생성합니다. 거리 행렬 D 클러스터 간 연결을 결정하는 데 사용되는 방법의 이름 맨해튼 거리를 사용하여 거리 행렬 D를 계산했습니다. d(x,y)=∑i|xi−yi|d(x,y)=∑i|xi−yi|d(x,y) = \sum_i|x_i - y_i| 여기서 및 n ≈ …

1
상태 공간 시계열 분석에서 어떤 모델이 더 나은지 확인하는 방법은 무엇입니까?
상태 공간 방법으로 시계열 데이터 분석을 수행하고 있습니다. 내 데이터를 사용하여 확률 론적 로컬 레벨 모델이 결정 론적 모델보다 완전히 뛰어났습니다. 그러나 결정적 수준 및 기울기 모델은 확률 적 수준 및 확률 적 / 결정적 기울기보다 더 나은 결과를 제공합니다. 이게 평범한가요? R의 모든 방법에는 초기 값이 필요하며 ARIMA 모델을 …


2
베이지안 통계와 생성 모델링 사이의 연결
누군가 베이지안 통계와 생성 모델링 기술 사이의 연관성을 설명하는 좋은 참고 자료를 알려줄 수 있습니까? 왜 베이 즈 기법과 함께 생성 모델을 사용 하는가? 완전한 데이터가없는 경우 베이지안 통계를 사용하는 것이 특히 매력적인 이유는 무엇입니까? 나는 기계 학습 중심의 관점에서 왔으며 통계 커뮤니티에서 그것에 대해 더 많이 읽고 싶습니다. 이러한 …


5
'공동 분포'와 '다변량 분포'라는 용어의 차이점은 무엇입니까?
나는 '다변량 분포'를 이해할 가능성이 높은 청중에게 '공동 확률 분포'를 사용하는 것에 대해 쓰고 있으므로 나중에 사용할 것을 고려하고 있습니다. 그러나 나는 이것을하는 동안 의미를 잃고 싶지 않습니다. Wikipedia 는 이것이 동의어임을 나타냅니다. 그들은? 그렇지 않다면 왜 안됩니까?

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.