통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
잔차의 크기로 데이터 세트를 계층화하고 2- 표본 비교를 수행하는 것이 전혀 방어력이 있습니까?
이것은 내가 일종의 ad-hoc 방법으로 수행하는 것으로 보이며 매우 비린 것처럼 보이지만 아마도 뭔가를 놓치고 있습니다. 다중 회귀 분석 에서이 작업을 수행했지만 간단하게 유지합시다. yi=β0+β1xi+εiyi=β0+β1xi+εi y_{i} = \beta_{0} + \beta_{1} x_{i} + \varepsilon_{i} 이제 적합 모형에서 잔차를 가져옵니다. ei=yi−(β^0+β^1xi)ei=yi−(β^0+β^1xi) e_{i} = y_{i} - \left( \hat{\beta}_{0} + \hat{\beta}_{1} x_{i} \right) 잔차의 …

6
가장 빠른 SVM 구현
더 일반적인 질문입니다. 예측 모델링을 위해 rbf SVM을 실행하고 있습니다. 현재 프로그램에 약간의 속도 향상이 필요하다고 생각합니다. 나는 scikit learn을 거친 그리드 검색 + 교차 유효성 검사와 함께 사용합니다. 각 SVM 실행에는 약 1 분이 걸리지 만 모든 반복 작업으로 인해 여전히 너무 느립니다. 결국 여러 코어에서 교차 유효성 검사 …

4
전력 법 배포의 직관
나는 전력 법칙 분포의 pdf가 p ( x ) = α − 1 임을 알고 있습니다.p(x)=α−1xmin(xxmin)−αp(x)=α−1xmin(xxmin)−α p(x) = \frac{\alpha-1}{x_{\text{min}}} \left(\frac{x}{x_{\text{min}}} \right)^{-\alpha} But what does it intuitively mean if, for example, stock prices follow a power law distribution? Does this mean that losses can be very high but infrequent?

8
짝을 이루지 않은 t- 검정의 최소 표본 크기
t- 검정이 유효하기 위해 필요한 최소 샘플 크기를 결정하는 "규칙"이 있습니까? 예를 들어, 두 모집단의 평균을 비교해야합니다. 한 모집단의 데이터 포인트는 7 개이고 다른 데이터 포인트의 데이터 포인트는 2 개뿐입니다. 불행히도 실험은 비용이 많이 들고 시간이 많이 걸리며 더 많은 데이터를 얻는 것은 불가능합니다. t- 검정을 사용할 수 있습니까? 그 …

2
양측 테스트 설명
나는 학생들에게 (초등 통계 과정에서) 양측 검정이 무엇인지, 그리고 P 값이 어떻게 계산되는지 설명하는 다양한 방법을 찾고 있습니다. 학생들에게 양측 및 단측 테스트를 어떻게 설명합니까?

6
큰 텍스트 모음을 어디에서 찾을 수 있습니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 육년 전 . 다운로드 할 큰 (> 1000) 텍스트 말뭉치를 찾고 있습니다. 세계 뉴스 나 어떤 종류의 보고서가있는 것이 바람직하다 . 특허가있는 제품 만 찾았습니다. 어떤 제안?
16 dataset 

2
보간의 통계적 정당화 란 무엇입니까?
우리가 두 점 (다음 그림 : 검은 원)을 가지고 있고 그 사이의 세 번째 점 (십자)에 대한 값을 찾고 싶다고 가정하십시오. 실제로 우리는 실험 결과 인 블랙 포인트를 기준으로 추정 할 것입니다. 가장 간단한 경우는 선을 그린 다음 값 (선형 보간)을 찾는 것입니다. 예를 들어, 양쪽에 갈색 점과 같은지지 점이있는 …

3
크고 똑똑한 베팅하기
1X2 (가중) 게임에서 베팅을 제안하는 알고리즘을 코딩하려고했습니다. 기본적으로 각 게임에는 경기 세트가 있습니다 (홈팀과 원정팀) : 1: 홈 승 X: 무승부 2: 승리 각 일치 및 기호 ( 1, X및 2)에 대해 해당 기호가 올바른 일치 결과 일 가능성을 나타내는 백분율을 지정합니다. 다음은 구조를 나타내는 배열입니다. $game = array ( …

11
R을 시작하고 배우는 방법?
나는 몇 번이나 "내 스스로 가려고"노력했지만 제한된 성공을 거두었 다. 저는 캐주얼 한 SPSS 사용자이며 일부 SAS 경험이 있습니다. 비슷한 배경을 가지고 있으며 이제 R을 사용하는 사람으로부터 한두 가지 조언을 부탁드립니다.
16 r  references 

4
1D 데이터 클러스터링
데이터 세트가 있는데 하나의 변수만을 기준으로 해당 데이터에 클러스터를 만들고 싶습니다 (결측 값이 없음). 하나의 변수를 기반으로 3 개의 클러스터를 만들고 싶습니다. 어떤 클러스터링 알고리즘, k- 평균, EM, DBSCAN 등을 사용해야합니까? 내 주요 질문은 어떤 상황에서 EM보다 k- 평균을 사용하거나 k- 평균보다 EM을 사용해야합니까?
16 clustering 

1
Kolmogorov-Smirnov를 사용하여 두 가지 실험 분포를 비교할 수 있습니까?
Kolmogorov-Smirnov 적합도 검정을 사용하여 두 개의 경험적 분포를 비교하여 하나의 경험적 분포를 사전 지정된 참조 분포와 비교하는 것이 아니라 동일한 기본 분포에서 나온 것으로 보이는지 확인하는 것이 좋습니까? 다른 방법으로 물어 보도록하겠습니다. 한 위치의 분포에서 N 개의 샘플을 수집합니다. 다른 장소에서 M 샘플을 수집합니다. 데이터는 연속적이지만 (각 샘플은 0과 10 …

2
차원 축소를 클러스터링과 언제 결합합니까?
문서 수준 클러스터링을 수행하려고합니다. 용어 문서 주파수 행렬을 구성했으며 k- 평균을 사용하여 이러한 고차원 벡터를 군집화하려고합니다. 직접 클러스터링 대신, 먼저 LSA (Latent Semantic Analysis) 특이 벡터 분해를 적용하여 U, S, Vt 행렬을 구하고, scree plot을 사용하여 적절한 임계 값을 선택하고 축소 된 행렬에 클러스터링을 적용했습니다 (특히 Vt 그것은 나에게 좋은 …

1
사용자 정의 분포에서 무작위 샘플 생성
R을 사용하여 사용자 정의 PDF에서 임의의 샘플을 생성하려고합니다. 내 PDF는 다음과 같습니다. 에프엑스( x ) = 32( 1 − x2) , 0 ≤ x ≤ 1에프엑스(엑스)=삼2(1−엑스2),0≤엑스≤1f_{X}(x) = \frac{3}{2} (1-x^2), 0 \le x \le 1 균일 한 샘플을 생성 한 다음이를 사용자 지정 배포로 변환하려고했습니다. 내 분포의 cdf ( )를 찾아 …
16 r  sampling  uniform 

2
'데이터 풀링'이란 정확히 무엇을 의미합니까?
'풀링 데이터'는 단순히 이전에 카테고리로 분리 된 데이터를 결합하는 것을 의미한다고 생각했습니다. 본질적으로 카테고리를 무시하고 데이터 세트를 하나의 거대한 데이터 풀로 만듭니다. 이것이 통계 적용보다 용어에 대한 질문이라고 생각합니다. 예를 들어 : 나는 두 개의 사이트를 비교하고 싶습니다. 각 사이트에는 두 가지 년 유형 (양호한 유형)이 있습니다. 두 사이트를 '전체'(즉, …

2
R을 사용하여“병렬 세트”플롯을 만들 수 있습니까?
잠김 . 이 질문과 주제는 주제가 다르지만 역사적 의미가 있기 때문에이 질문과 답변은 잠겨 있습니다. 현재 새로운 답변이나 상호 작용을받지 않습니다. Tormod 질문 ( 여기에 게시 됨 ) 덕분에 Parallel Sets 플롯을 발견했습니다. 다음은 그 모습을 보여주는 예입니다. (타이타닉 데이터 셋의 시각화입니다. 예를 들어, 살아남지 못한 대부분의 여성이 세 번째 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.