통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
공분산 구조 지정 : 장단점
공분산 행렬의 모든 비 대각선 항목을 0으로 처리하지 않고 GLM에서 공분산 구조를 지정하면 어떤 이점이 있습니까? 데이터에 대해 아는 것을 반영하는 것 외에도 착용감 향상? 보류 된 데이터의 예측 정확도를 향상 시킵니까? 공분산의 정도를 추정 할 수 있습니까? 공분산 구조를 부과하는 비용은 얼마입니까? 그렇습니까 추정 알고리즘에 대한 계산상의 합병증을 추가합니까? …

3
다른 예측 (예 : MSE)과 달리 특정 측정 오차 (예 : MAD)를 사용하는 이유는 무엇입니까?
MAD = 평균 절대 편차 MSE = 평균 제곱 오차 나는 몇몇 바람직하지 않은 특성에도 불구하고 MSE가 사용되는 여러 곳에서 제안을 보았다 (예 : http://www.stat.nus.edu.sg/~staxyc/T12.pdf , p8에 나와 있음) MSE보다 더 나은 기준이지만 MAD보다 수학적으로 MSE가 더 편리합니다. ") 그것보다 더 있습니까? 예측 오차를 측정하는 다양한 방법이 더 적합하거나 적은 …
15 forecasting  error  mse  mae 

1
혼합 모델 결과 시각화
혼합 모델에서 항상 겪었던 문제 중 하나는 결과를 얻은 후에는 종이나 포스터로 끝날 수있는 데이터 시각화를 파악하는 것입니다. 지금은 다음과 같은 공식을 사용하여 포아송 혼합 효과 모델을 작업 중입니다. a <- glmer(counts ~ X + Y + Time + (Y + Time | Site) + offset(log(people)) glm ()에 맞는 것을 …

7
임의의 숲이 과적 합
scikits-learn에서 Random Forest Regression을 사용하려고합니다. 문제는 테스트 오류가 매우 높다는 것입니다. train MSE, 4.64, test MSE: 252.25. 내 데이터 모양은 다음과 같습니다. (파란색 : 실제 데이터, 초록색 : 예측 됨) : 훈련에 90 %, 시험에 10 %를 사용하고 있습니다. 이것은 여러 매개 변수 조합을 시도한 후 사용중인 코드입니다. rf = …

1
변수 내 오류 회귀 : 세 사이트의 데이터를 풀링하는 것이 유효합니까?
FDA 검토자가 사이트의 데이터를 풀링 할 때 두 사이트에 일부 샘플이 포함 된 3 개 사이트의 풀링 데이터가 포함되어 있기 때문에 FDA 검토자가 해당 변수의 오류 회귀가 유효하지 않다고 말했기 때문에 최근에 고객이 부트 스트랩 분석을 수행하게되었습니다. 똑같다. 배경 고객은 기존의 승인 된 방법과 "동등한"방법을 보여주고 자하는 새로운 분석 방법을 …

3
통계적 무작위성에 대한 몇 가지 질문
에서 위키 백과의 통계 randoness : 글로벌 임의성과 로컬 임의성이 다릅니다. 무작위성에 대한 대부분의 철학적 개념은 전역 적이다. 왜냐하면 어떤 하위 시퀀스가 ​​무작위 적으로 보이지 않더라도 "장기적으로"시퀀스는 실제로 무작위로 보인다는 생각에 근거하기 때문이다. 예를 들어, 길이가 충분한 "정확한"난수 시퀀스에서는 0이 아닌 긴 시퀀스가있을 가능성이 있지만 전체적으로 시퀀스는 무작위 일 수 …

11
포아송이 아닌 프로세스의 예?
학생들에게 Poisson 분포를 설명하는 데 도움이되는 Poisson 분포를 사용하여 모델링하기에 적합하지 않은 상황의 좋은 예를 찾고 있습니다. 일반적으로 Poisson 분포로 모델링 할 수있는 예로 간격으로 상점에 도착하는 고객 수를 사용합니다. 비슷한 맥락에서 반대의 예를 찾고 있습니다. 즉, Poisson이 아닌 연속 시간에 양수 계산 프로세스로 간주 될 수있는 상황입니다. 학생들이 이해하고 …

5
대학원 통계 과정에서 제공하는 수준의 통계를 제공하는 오픈 소스 Java 라이브러리
나는 적용되는 자료의 수준에 대한 느낌을주기 위해 다음 교과서를 사용하는 응용 통계학 대학원 과정을 밟고 있습니다 : 통계 개념 및 방법 , GK Bhattacharyya 및 RA Johnson. 교수는 숙제를 위해 SAS를 사용해야합니다. 내 질문은 : Java 라이브러리가 있습니까?이 라이브러리는 일반적으로 그러한 클래스에서 볼 수있는 문제에 대해 SAS 대신 사용할 수 …
15 r  sas  java 

2
교차 검증에서 평균 (점수) vs 점수 (연결)
TLDR : 내 데이터 세트는 매우 작은 (120) 샘플입니다. 10 배 교차 검증을 수행하는 동안 다음을 수행해야합니다. 각 테스트 폴드에서 출력을 수집하여 벡터로 연결 한 다음이 전체 예측 벡터 (120 개 샘플)에 대한 오류를 계산합니까? 또는 대신 각 겹 에서 얻은 출력 (폴드 당 12 샘플)의 오류를 계산 한 다음 …

3
2 차 또는 교호 작용 항은 분리 된 의미에서 유의하지만 둘 다 함께 있지는 않습니다.
과제의 일환으로 예측 변수가 두 개인 모형을 적합시켜야했습니다. 그런 다음 포함 된 예측 변수 중 하나에 대해 모형의 잔차 그림을 그려야하며이를 바탕으로 변경해야합니다. 이 플롯은 곡선 추세를 보여 주므로 해당 예측 변수에 대한 2 차 항을 포함 시켰습니다. 새로운 모델은 2 차 항이 유의하다는 것을 보여주었습니다. 지금까지는 모두 좋았습니다. 그러나 …

3
Schoenfeld 잔차가 좋지 않을 때 비례 위험 회귀 모형의 옵션은 무엇입니까?
coxph많은 변수를 포함 하는를 사용하여 R에서 Cox 비례 위험 회귀를 수행하고 있습니다. Martingale 잔차는 훌륭해 보이며, Schoenfeld 잔차는 모든 변수에 가장 좋습니다. Schoenfeld 잔차가 평탄하지 않은 변수는 세 가지가 있으며 변수의 특성은 시간에 따라 변할 수 있다는 의미입니다. 이것들은 내가 정말로 관심이없는 변수이므로 계층화하는 것이 좋습니다. 그러나 이들 모두는 범주 …

2
무차별 원칙이 Borel-Kolmogorov 역설에 적용됩니까?
무관심 의 원칙을 사용하여 Bertrand 역설 에 대한 Jaynes의 솔루션을 고려하십시오 . 왜 비슷한 주장이 Borel-Kolmogorov 역설에 적용되지 않습니까? 문제가 구의 방향을 지정하지 않기 때문에 구를 회전하면 선택한 제한 프로세스에 의해 도달 한 결과 분포에 영향을 미치지 않아야한다고 주장하는 데 문제가 있습니까?
15 theory  paradox 

3
데이터 블렌딩이란 무엇입니까?
이 용어는 메소드 관련 스레드 에서 자주 나타납니다 . 되어 혼합 데이터 마이닝 및 통계 학습의 특정 방법을? Google에서 관련 결과를 얻을 수 없습니다. 블렌딩은 많은 모델의 결과를 혼합하여 더 나은 결과를 가져온 것 같습니다. 그것에 대해 더 잘 아는 데 도움이되는 자료가 있습니까?

3
가장 강력한 상관 관계가있는 데이터 포인트의 하위 집합을 선택하는 자동 절차?
상관 관계가 가장 큰 (2 차원 만) 더 큰 풀에서 데이터 포인트의 하위 집합을 선택하기위한 표준 절차 (예 : 참조로 인용 할 수 있음)가 있습니까? 예를 들어 100 개의 데이터 포인트가 있다고 가정합니다. X 및 Y 치수를 따라 가능한 가장 강한 상관 관계가있는 40 점의 하위 집합을 원합니다. 이 작업을 …

3
통계량 대 통계량 사용시기에 대한 혼동
나는 신뢰 구간을 계산 하기 위해이 비디오 강의를 언급하고있었습니다 . 그러나 혼란이 있습니다. 이 사람은 계산에 통계를 사용하고 있습니다. 그러나, 나는 그것이 있었어야 생각 t의 통계량. 모집단의 실제 표준 편차는 제공되지 않습니다. 실제 표준 편차를 추정하기 위해 표본 표준 편차를 사용하고 있습니다.zzzttt 그렇다면 왜 아닌 신뢰 구간에 대해 정규 분포를 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.