통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
평균 차이와 평균 차이
두 개의 독립적 인 표본 수단을 연구 할 때 "두 수단의 차이"를보고 있다고 들었습니다. 이는 모집단 1 에서 평균을 ( ) 모집단 2에서 평균을 빼는 것을 의미합니다 ( ). (그래서, 우리의 "두 가지 방법의 차이는" - ).와이¯1와이¯1\bar y_1와이¯2와이¯2\bar y_2와이¯1와이¯1\bar y_1와이¯2와이¯2\bar y_2 쌍을 이룬 표본을 연구 할 때 우리는 "평균 차이", …

1
분수 차이 수식 이해
나는 시계열이 하고 나는 ARFIMA (FARIMA 일명) 과정으로 모델링하고 싶습니다. 경우 (소수)의 순서로 통합 , I는 분별 차분 그것이 정지하게하고 싶다.와이티와이티y_t와이티와이티y_t디디d 질문 : 분수 미분을 정의하는 다음 공식이 맞습니까? Δ디와이티: =와이티− d와이t - 1+디( d− 1 )2 !와이t - 2−디( d− 1 ) ( 일− 2 )3 !와이t - 3+ …




2
PCA가 예상의 총 분산을 최대화하는 이유는 무엇입니까?
Christopher Bishop은 자신의 저서 인 Pattern Recognition and Machine Learning 을 통해 데이터가 이전에 선택한 구성 요소에 직교 공간으로 투영 된 후 각 연속 주성분이 투영의 분산을 1 차원으로 최대화한다는 증거를 작성합니다. 다른 사람들도 비슷한 증거를 보여줍니다. 그러나 이는 분산을 최대화한다는 점에서 연속 된 각 구성 요소가 하나의 차원으로 가장 …

2
f- 측정은 정확성과 동의어입니까?
나는 f- 측정 (정밀도와 리콜에 기초한)이 분류 기가 얼마나 정확한지 추정한다는 것을 이해합니다. 또한 불균형 데이터 세트가있을 때 정확도보다 f- 측정이 선호 됩니다. 간단한 질문이 있습니다 (기술보다는 올바른 용어를 사용하는 것에 관한 것입니다). 불균형 데이터 세트가 있으며 실험에서 f- 측정을 사용합니다. 머신 러닝 / 데이터 마이닝 회의 가 아닌 논문을 …

2
백분율 데이터의 분포
내 데이터로 모델을 만드는 데 사용할 올바른 분포에 대한 질문이 있습니다. 나는 50 개의 플롯으로 삼림 인벤토리를 수행했으며 각 플롯은 20m × 50m입니다. 각 음모에 대해 땅을 가리는 나무 캐노피의 비율을 추정했습니다. 각 플롯에는 캐노피 덮개에 대한 하나의 값 (백분율)이 있습니다. 백분율은 0에서 0.95 사이입니다. 위성 이미지 및 환경 데이터를 …


1
비중 심성 매개 변수-무엇이며, 무엇을하며, 제안 된 값은 무엇입니까?
특히 표본 크기 결정 및 통계 검정력 분석과 관련하여 통계 지식을 정리하려고했습니다. 그러나 읽을수록 더 많이 읽을 필요가있는 것 같습니다. 어쨌든 나는 필요한 모든 것을하는 것처럼 보이는 G * Power 라는 도구를 찾았 지만 Noncentrality Parameter를 이해하는 데 문제가 있습니다. Wikipedia 등에 대한 정보가 불완전하거나 잘 이해하지 못하고 있습니다. 그것이 …

1
선형 회귀 분석의 정규성 가정
선형 회귀의 가정으로, 오차 분포의 정규성은 때때로 "확장"되거나 y 또는 x의 정규성이 필요하다고 해석됩니다. X와 Y가 비정규이지만 오차항이 존재하여 얻어진 선형 회귀 추정값이 유효한 시나리오 / 데이터 세트를 구성 할 수 있습니까?

3
선형 판별 분석 (LDA)의 스케일링 값을 사용하여 선형 판별에 설명 변수를 그릴 수 있습니까?
주성분 분석을 통해 얻은 Biplot 값을 사용하여 각 주성분을 구성하는 설명 변수를 탐색 할 수 있습니다. 선형 판별 분석에서도 가능합니까? 제공된 데이터는 "Edgar Anderson의 홍채 데이터"( http://en.wikipedia.org/wiki/Iris_flower_data_set )입니다. 홍채 데이터 는 다음과 같습니다 . id SLength SWidth PLength PWidth species 1 5.1 3.5 1.4 .2 setosa 2 4.9 3.0 1.4 …

2
두 카드의 카드 사이의 상관 관계
오버 핸드 카드 셔플 을 시뮬레이션하는 프로그램을 작성했습니다 . 각 카드는 번호가 매겨지며, 소송 CLUBS, DIAMONDS, HEARTS, SPADES은 2에서 10까지, 그 다음에는 Jack, Queen, King 및 Ace입니다. 따라서 두 클럽의 수는 1, 세 클럽의 수는 2입니다 ..... 에이스 클럽은 13입니다 ... 스페이드 에이스는 52입니다. 카드를 섞는 방법을 결정하는 방법 중 …

3
Friedman 테스트 후 Nemenyi 사후 테스트를 올바르게 적용하는 방법
여러 데이터 세트에서 여러 알고리즘의 성능을 비교하고 있습니다. 이러한 성능 측정이 정규 분포를 보장하지는 않기 때문에 Demšar (2006)를 기반으로 Nemenyi 사후 테스트를 통해 Friedman Test를 선택했습니다 . 그런 다음 후속 Shaffer post-hoc 테스트로 Quade 테스트와 같은 다른 방법을 제안하는 것 외에도 Nemenyi 테스트를 다르게 적용하는 다른 논문을 발견했습니다. Nemenyi 사후 …

1
부트 스트랩 유의성 검정의 두 가지 방법
부트 스트랩을 사용하여 두 가지 방법을 사용하여 p의 유의성 검정 값을 계산합니다. 귀무 가설 하에서 리샘플링하고 최소한 원래 데이터에서 나오는 결과만큼 극단적 인 결과를 계산 대립 가설 하에서 리샘플링하고 귀무 가설에 해당하는 값으로 최소한 원래 결과에서 먼 결과를 계산 나는 첫 번째 접근 방식이 p 값의 정의를 따르기 때문에 완전히 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.