통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
잘린 분포는 무엇을 의미합니까?
동적 시스템의 일반적인 미분 방정식 모델의 감도 분석에 관한 연구 논문에서 저자는 모델 매개 변수의 분포를 정규 분포 (평균 = 1e-4, 표준 = 3e-5)로 [0.5e -4 1.5e-4]. 그런 다음 모형의 시뮬레이션에이 잘린 분포의 표본을 사용합니다. 잘린 분포와이 잘린 분포의 표본이 있다는 것은 무엇을 의미합니까? 이 작업을 수행하는 두 가지 방법이 …

1
언밸런스 드 클래스 오버 / 언더 샘플링시 정확도를 극대화하는 것은 오 분류 비용을 최소화하는 것과 다른가?
우선, 데이터 마이닝 책에서 언밸런스 드 데이터 세트 를 처리하는 방법을 설명하는 데 사용되는 일반적인 레이아웃에 대해 설명하겠습니다 . 일반적으로 주 섹션은 언밸런스 드 데이터 셋 (Unbalanced Datasets)으로 구성되며 비용에 민감한 분류 및 샘플링 기법이라는 두 가지 하위 섹션을 포함합니다. 드문 클래스 에서 문제가 발생 하면 비용에 민감한 분류와 샘플링을 …

8
머신 러닝을위한 "핫 알고리즘"은 무엇입니까?
이것은 기계 학습을 배우기 시작한 누군가의 순진한 질문입니다. 저는 요즘 Marsland의 "Machine Learning : 알고리즘 관점"이라는 책을 읽고 있습니다. 소개 책으로 유용하다고 생각하지만 현재는 최상의 결과를 제공하는 고급 알고리즘으로 가고 싶습니다. 나는 주로 생물 정보학에 관심이있다 : 생물학적 네트워크의 클러스터링과 생물학적 염기 서열에서의 패턴 발견, 특히 단일 염기 다형성 (SNP) …

4
통계적 맥락을 소화하는 방법?
먼저, 이 흥미로운 사이트의 모든 활동 회원이 통계 전문가 가 아니라고 생각합니다 . 그렇지 않으면 다음과 같은 질문이 의미가 없습니다! 물론 그것들을 존중하지만 개념보다는 좀 더 실용적인 설명이 필요합니다. 나는 Wikipedia 의 예제로 시작 하여 다음을 정의합니다 point process. S를 Borel σ- 대수 B (S)가 장착 된 로컬로 초소형의 계산 …


3
R에서 Levene 테스트 기능을 사용하는 방법은 무엇입니까?
나는 통계와 R에 초보자이며 Levene 함수를 사용하는 데 문제가 있습니다 (두 샘플의 분산 평등을 확인하고 싶습니다). 설명서에는 다음을 실행해야한다고 나와 있습니다. levene.test (y, 그룹) 그러나 나는 y와 그룹으로 무엇을 넣어야할지 모르겠습니다. 분산의 동등성을 확인하려는 두 가지 다른 샘플이 있습니다. 샘플 값 중 하나를 y로, 두 번째 값을 그룹 매개 변수로 …

2
EDA에 대한 베이지안 접근 방식과 빈번한 접근 방식에는 차이가 있습니까?
간단히 말해서 : 탐색 데이터 분석에 대한 베이지안 접근 방식과 빈번한 접근 방식에 차이가 있습니까? 히스토그램은 히스토그램, 산점도는 산점도 등으로 EDA 방법에 내재 된 편견이 없음을 알고 있으며 EDA가 가르치거나 제시되는 방법의 차이점에 대한 예를 찾지 못했습니다 (특히 A. Gelman의 이론적 논문은 무시). . 마지막으로, 적용되는 모든 것들의 중재자 인 …

1
SVM에서 초평면으로부터의 거리 해석
SVM을 직관적으로 이해하는 데는 몇 가지 의심이 있습니다. SVMLight 또는 LibSVM과 같은 일부 표준 도구를 사용하여 분류를 위해 SVM 모델을 학습했다고 가정합니다. 테스트 데이터 예측에이 모델을 사용하면 모델은 각 테스트 포인트에 대해 "알파"값을 가진 파일을 생성합니다. 알파 값이 양수이면 테스트 포인트가 클래스 1에 속하고 그렇지 않으면 클래스 2에 속합니다. 이제 …


3
비교를 위해 바이올린 플롯을 스케일링하는 방법은 무엇입니까?
나는 바이올린 음모를 그리려고 노력하고 있으며 그룹별로 스케일링을위한 모범 사례가 있는지 궁금합니다. 다음은 R mtcars데이터 세트를 사용하여 시도한 세 가지 옵션 입니다 (1973의 모터 트렌드 자동차, 여기 참조 ). 동일한 폭 원래 종이 * 가하는 것과 R 이하 vioplot는 것 ( 예 :) 인 것 같습니다 . 모양을 비교하는 데 …

1
다변량 가우스 분포에서 값 생성
I는 현재의 시뮬레이션 값을 시도하고 NNN 차원 랜덤 변수 XXX 의 평균 벡터 다변량 정규 분포를 갖는 μ=(μ1,...,μN)Tμ=(μ1,...,μN)T\mu = (\mu_1,...,\mu_N)^T 및 공분산 행렬 SSS . 역 CDF 방법과 유사한 절차를 사용하고 싶습니다. 먼저 NNN 차원의 균일 랜덤 변수 생성 한 UUU다음이 분포의 역 CDF에 연결하여 값 X 를 생성 하고 …

2
박스 젠킨스 모델 선택
시계열 분석에서 Box-Jenkins 모델 선택 절차는 시리즈의 자기 상관 및 부분 자기 상관 함수를 살펴 보는 것으로 시작합니다. 이러한 도표 는 ARMA 모델 에서 적절한 ppp 및 를 제안 할 수 있습니다 . 이 절차는 사용자에게 AIC / BIC 기준을 적용하여 화이트 노이즈 오류 항이있는 모델을 생성하는 모델 중에서 가장 …

2
R을 사용한 텍스트 마이닝의 예 (tm 패키지)
나는 tm친구가 초안을 읽고 UCINET으로 텍스트 코퍼스를 탐색하고 텍스트 클라우드, 2 모드 네트워크 그래프 및 단일 값 분해 (Stata를 사용하는 그래픽 포함)를 보여준 지 3 일을 보냈다 . Mac OS X에서는 Snowball (stemming) 또는 Rgraphviz (graphs)와 같은 라이브러리 뒤에 Java 관련 문제가 있습니다. 누군가 포인트 아웃 할 수 없는 패키지 …
14 r  text-mining 

3
단일성으로 균일하게 분포 된 가중치를 생성합니까?
혼합 모델링과 같은 응용 분야에서 가중치를 사용하고 기본 기능을 선형으로 결합하는 것이 일반적입니다. 가중치 는 종종 0 및 준수해야합니다 . 이러한 벡터의 균일 분포에서 가중치 벡터 \ mathbf {w} = (w_1, w_2,…) 를 무작위로 선택하고 싶습니다 .w i ≥ ∑ i w i = 1 w = ( w 1 …

1
진행중인 기간에 대한 예측 오류 (신뢰 구간)를 계산하는 방법은 무엇입니까?
월간 데이터 시리즈에서 향후 기간을 예측해야하는 경우가 종종 있습니다. 시계열에서 다음 기간에 대한 알파의 신뢰 구간을 계산하는 공식을 사용할 수 있지만 여기에는 두 번째 기간과 세 번째 등을 처리하는 방법이 포함되지 않습니다. 어떤 예측이 신뢰 구간을 상하로 그래프로 표시 할 경우 불확실성이 누적 력이므로 일반적으로 이러한 구간이 평균 예측에 비해 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.