통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
정보 지오메트리를 사용하여 거리와 부피를 정의하는 것… 유용합니까?
저는 확률 분포 공간에서 Fisher의 정보 지표를 자연 지역 지표로 사용하고이를 통합하여 거리와 부피를 정의하는 것을 옹호 하는 많은 문헌을 발견했습니다. 그러나 이러한 "통합 된"수량이 실제로 무엇에 유용합니까? 나는 이론적 인 정당화와 실제 적용이 거의 없음을 발견했다. 하나는 가이 레바논의 작품 으로 "피셔 거리"를 사용하여 문서를 분류하고 다른 하나는 로드리게스 …

5
데이터 시각화 기술의인지 처리 / 해석
다른 시각화 기술의 효과 (이해 가능성)를 조사하는 연구에 대해 아는 사람이 있습니까? 예를 들어 사람들이 한 형태의 시각화를 다른 형태에 비해 얼마나 빨리 이해합니까? 시각화와의 상호 작용이 사람들이 데이터를 기억하는 데 도움이됩니까? 그 라인을 따라 무엇이든. 시각화의 예는 산점도, 그래프, 타임 라인,지도, 대화 형 인터페이스 (예 : 병렬 좌표) 등입니다. …


5
다른 길이의 시계열에 대한 SVD 차원 축소
특이 값 감소 기술로 특이 값 분해를 사용하고 있습니다. N차원이 주어진 벡터는 D상관 관계가없는 차원으로 변환 된 공간의 특징을 나타내며,이 공간의 고유 벡터에있는 데이터 정보의 대부분을 중요도가 감소하는 순서로 요약합니다. 이제이 절차를 시계열 데이터에 적용하려고합니다. 문제는 모든 시퀀스의 길이가 같지 않기 때문에 실제로 num-by-dim행렬을 만들고 SVD를 적용 할 수 없다는 …

4
데이터 익명화 소프트웨어
잠김 . 이 질문과 주제는 주제가 다르지만 역사적 의미가 있기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. 누구나 좋은 데이터 익명화 소프트웨어를 알고 있습니까? 아니면 데이터 익명화를 수행하는 R 용 패키지입니까? 분명히 깨지지 않는 익명화를 기대하지는 마십시오-단지 그것을 어렵게 만들고 싶습니다.
13 software 

4
표본에서 두 모집단 분리
단일 데이터 세트에서 두 개의 값 그룹을 분리하려고합니다. 모집단 중 하나가 정규 분포이고 표본 크기의 절반 이상이라고 가정 할 수 있습니다. 두 번째 값은 첫 번째 값보다 낮거나 높습니다 (배포를 알 수 없음). 내가하려는 것은 정상적으로 분포 된 인구를 다른 사람들과 묶는 상한과 하한을 찾는 것입니다. 내 가정은 시작점을 제공합니다. …

3
선형 혼합 효과 모델
나는 LME 모델이 정확도 데이터 분석에서 (즉, 심리학 실험에서) 더 전통적인 방법 (예를 들어, ANOVA)이 할 수없는 이항 및 기타 비정규 분포와 함께 작동 할 수 있다는 점에서 더 잘 들었다. 이러한 다른 분포를 통합 할 수있는 LME 모델의 수학적 기초는 무엇이며,이를 설명하는 기술이 아닌 논문은 무엇입니까?

2
시계열 분석을 사용하여 폭력적 행동 분석 / 예측
이것은 약간의 플립 판트 질문이지만 대답에 진지한 관심이 있습니다. 나는 정신 병원에서 일하고 있으며, 와드의 폭력 수준과 관련하여 매일 각 와드에서 수집되는 3 년간의 데이터를 가지고 있습니다. 분명히이 데이터에 맞는 모델은 시계열 모델입니다. 좀 더 평범하게하기 위해 점수를 달리해야했습니다. 나는 차분 된 데이터로 ARMA 모델을 적합 시켰으며, 내가 생각하기에 가장 …

5
예측을 위해 여러 모델을 사용해야하는 경우
이것은 상당히 일반적인 질문입니다. 나는 일반적으로 여러 다른 모델을 사용하면 샘플에서 시계열을 예측하려고 할 때 하나의 모델보다 뛰어납니다. 모델 조합이 단일 모델보다 성능이 뛰어남을 보여주는 좋은 논문이 있습니까? 여러 모델을 결합하는 모범 사례가 있습니까? 일부 참고 문헌 : Hui Zoua, Yuhong Yang "예측을위한 시계열 모델 결합" International Journal of Forecasting …

2
GLM 계열은 반응 변수 또는 잔차의 분포를 나타 냅니까?
나는 이것에 관해 몇몇 실험실 멤버들과 논의하고 있으며, 우리는 몇 가지 소스로 갔지만 여전히 대답이 없습니다. GLM에 포아송 계열이 있다고 가정 하면 잔차 또는 반응 변수의 분포에 대해 이야기하고 있습니까? 경합의 포인트 이 기사를 읽으면 GLM의 가정은 통계적 독립성 , 링크 및 분산 함수의 정확한 사양 (응답 변수가 아닌 잔차에 …

1
랜덤 포레스트에서 왜 트리 레벨이 아닌 노드 레벨에서 기능의 랜덤 서브 세트가 선택됩니까?
내 질문 : 왜 임의 포리스트 는 트리 수준이 아닌 각 트리 내의 노드 수준 에서 분할하기 위해 기능의 임의 하위 집합을 고려 합니까? 배경 : 이것은 역사 문제입니다. 주석 캄 호 출판 이 논문을 무작위로 성장하기 위해서 사용하는 기능의 일부를 선택하여 "결정 숲을"건설에 나무를 2001 년 이후 1998 년 …

1
이진 분류 설정에서 정확도가 부적절한 점수 규칙입니까?
나는 최근에 확률 론적 분류 자에 대한 적절한 채점 규칙에 대해 배우고있다. 이 웹 사이트의 여러 스레드는 정확성이 부적절한 점수 규칙이며 로지스틱 회귀와 같은 확률 모델에 의해 생성 된 예측의 품질을 평가하는 데 사용해서는 안된다는 점을 강조했습니다. 그러나 내가 읽은 꽤 많은 학술 논문은 이진 분류 설정에서 (엄격하지 않은) 적절한 …

2
모델을 만들기 위해 평균 회귀 계수에 이론적 인 문제가 있습니까?
각각 전체 데이터의 하위 집합을 기반으로 평균 여러 OLS 모델 인 회귀 모델을 만들고 싶습니다. 이것에 대한 아이디어는 이 논문을 기반으로 합니다 . k 개의 폴드를 생성하고 각각의 폴드없이 데이터에 k 개의 OLS 모델을 구축합니다. 그런 다음 회귀 계수를 평균하여 최종 모델을 얻습니다. 이것은 여러 개의 회귀 트리가 만들어지고 평균화되는 …

1
Halmos-Savage 정리에 대한 직관적 이해
Halmos에-야만인 정리 라고하는 지배적 통계 모델 통계 모든 에 대해 측정 가능 버전의 Radon Nikodym 유도체 가있는 경우 이면 충분합니다. 여기서 는 대해 및 와 같은 특권 측정 .(Ω,A,P)(Ω,A,P)(\Omega, \mathscr A, \mathscr P)T:(Ω,A,P)→(Ω′,A′)T:(Ω,A,P)→(Ω′,A′)T: (\Omega, \mathscr A, \mathscr P)\to(\Omega', \mathscr A'){P∈P}{P∈P}\{P \in \mathscr{P} \} TTTdPdP∗dPdP∗\frac{dP}{dP*}dP∗dP∗dP*P∗=∑∞i=1PiciP∗=∑i=1∞PiciP*=\sum_{i=1}^\infty P_i c_i ci>0,∑∞i=1ci=1ci>0,∑i=1∞ci=1c_i >0, \sum _{i=1}^\infty …

11
표준 편차가 완전히 잘못 되었습니까? 신장, 수 등 (정수)에 대한 표준 수치를 어떻게 계산할 수 있습니까?
높이 (cm)를 계산하고 숫자가 0보다 높아야한다고 가정 해 봅시다. 다음은 샘플 목록입니다. 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 이 예에서는 정규 분포에 따라 값의 99.7 %가 평균에서 표준 편차의 ± 3 배 사이 여야합니다. 그러나 표준 편차의 두 배라도 음수가됩니다. -2 x …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.