통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
시뮬레이션 연구 : 반복 횟수를 선택하는 방법?
"모델 1"로 데이터를 생성하고 "모델 2"에 맞 춥니 다. 기본 아이디어는 "모델 2"의 견고성 속성을 조사하는 것입니다. 특히 95 % 신뢰 구간 (보통 근사치 기준)의 적용률에 관심이 있습니다. 반복 실행 횟수를 어떻게 설정합니까? 필요한 복제보다 큰 복제가 잘못된 편견을 초래할 수 있습니까? 그렇다면 어떻게됩니까?

2
순수 수학자에게 적용되는 확률에 대한 소개?
나는 순수한 수학 (Measure Theory, Functional Analysis, Operator Algebra 등)에서 대학원 수준의 배경을 가지고 있습니다. 또한 확률 이론에 대한 지식 (기본 원리에서 기계 학습 기술에 이르기까지)이 필요한 직업도 있습니다. 내 질문 : 누군가가 다음과 같은 표준 읽기 및 참조 자료를 제공 할 수 있습니까? 확률 이론에 대한 독립적 인 소개 …

2
GLM 출력의 분산 매개 변수
R에서 glm을 실행했으며 summary()출력 하단 근처에서 (Dispersion parameter for gaussian family taken to be 28.35031) Google에서 일부 문제를 해결했으며 분산 매개 변수가 표준 오류에 적합하다는 것을 알았습니다. 분산 매개 변수가 무엇이며 어떻게 해석 해야하는지에 대한 자세한 내용을 누군가가 제공 할 수 있기를 바랍니다.

1
리지와 LASSO는 공분산 구조를 가지고 있습니까?
통계 학습의 요소 (Hastie, Tibshrani & Friedman) 3 장을 읽은 후 공분산 구조를 고려하여이 질문의 제목에 인용 된 유명한 축소 방법을 구현할 수 있는지 궁금했습니다. ) 수량 ( y⃗ − Xβ⃗ )티V− 1( y⃗ − Xβ⃗ ) + λ f( β) , ( 1 ) (y→−Xβ→)TV−1(y→−Xβ→)+λf(β), (1)(\vec{y}-X\vec{\beta})^TV^{-1}(\vec{y}-X\vec{\beta})+\lambda f(\beta),\ \ \ …

3
LASSO 모델에서 를 선택하는 것이 얼마나 방어 적인가?
교차 검증을 통해 람다를 결정할 때 모든 계수는 0이됩니다. 그러나 일부 예측 변수가 결과에 확실히 영향을 주어야한다는 문헌에 대한 힌트가 있습니다. 람다를 임의로 선택하여 원하는만큼의 희소성이있는 것이 쓰레기입니까? 콕스 모델에 대해 135 개 중 10 개 정도의 예측 변수를 선택하려고하지만 불행히도 효과 크기가 작습니다.
11 lasso 


2
표준화 된 계수를 표준화되지 않은 계수로 변환하는 방법은 무엇입니까?
나의 목표는 독립적 인 변수 세트가 주어지면 실제 결과를 예측하기 위해 주제에 대한 이전 연구에서 얻은 계수를 사용하는 것입니다. 그러나 연구 논문은 베타 계수와 t- 값만 나열합니다. 표준화 된 계수를 표준화되지 않은 계수로 변환 할 수 있는지 알고 싶습니다. 예측 값을 계산하기 위해 표준화되지 않은 독립 변수를 표준화 된 변수로 …

2
부분적으로 시뮬레이션 된 데이터에 대해 메타 분석을 수행하지 않는 이유는 무엇입니까?
배경: 심리학에서의 전형적인 메타 분석은 두 변수 X와 Y 사이의 상관 관계를 모델링하려고 시도 할 수있다. 분석은 일반적으로 샘플 크기와 함께 문헌으로부터 일련의 관련 상관 관계를 얻는 것을 포함한다. 그런 다음 수식을 적용하여 가중 평균 상관 관계를 계산할 수 있습니다. 그런 다음, 무작위 샘플링의 단순한 효과에 의해 암시되는 것보다 더 …

4
OLS에서 생략 된 가변 바이어스에 대한 테스트가 있습니까?
비선형 종속성을 감지 할 수있는 Ramsey Reset 테스트를 알고 있습니다. 그러나 회귀 계수 중 하나 (단순한 선형 종속성) 만 버리는 경우 상관 관계에 따라 편차가 발생할 수 있습니다. 이것은 재설정 테스트에 의해 감지되지 않습니다. 이 경우에 대한 테스트를 찾지 못했지만이 명령문은 "잠재적 인 생략 가능한 변수를 포함하지 않으면 OVB를 테스트 …

3
데이터 마이너를위한 실험 설계 과정
저는 데이터 마이닝에서 일하는 컴퓨터 과학자입니다. 컴퓨터 과학자들이 체계적인 실험 설계 및 평가를 수행하는 데 상당히 열악하다고 말하는 것은 비밀이 아닙니다. p- 값 및 신뢰도 추정의 사용은 고급으로 간주됩니다. 좋은 실험 디자인에 대해 컴퓨터 과학자들에게 가르 칠 수있는 좋은 코스 / 자료가 있는지 알고 싶습니다. 이를보다 구체적으로하기 위해 다음 정보를 …

2
참조 정보 ?
그의에서 대답 내 이전 질문, @Erik P.는 식 준다 여기서 는 분포 의 초과 첨도 입니다. 표본 분산 분포 에 대한 Wikipedia 항목에 대한 참조 가 제공되지만 Wikipedia 페이지에는 "인용 필요"라고 표시되어 있습니다.κV a r [ s2] = σ4( 2엔- 1+ κ엔),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa 내 주요 …

3
평균 SD 또는 중간 MAD는 매우 괴상한 변수를 요약하면?
나는 치우친 데이터를 연구하고 있으므로 중앙 경향을 요약하기 위해 평균 대신 중간 값을 사용하고 있습니다. 분산을 측정하고 싶습니다 . 중심 경향을 요약하기 위해 평균 표준 편차±±\pm± ± 또는 중앙 사 분위수±±\pm 를 보고하는 사람들이 종종 있지만 중앙값 중앙값 절대 분산 (MAD)±±\pm 을보고해도 괜찮 습니까? 이 방법에 잠재적 인 문제가 있습니까? …


2
분류를 위해 SVM과 함께 Adaboost 사용
Adaboost 는 일련의 약한 분류기의 선형 조합을 사용하여 강력한 분류기를 생성하려고 시도 한다는 것을 알고 있습니다. 그러나 특정 조건 및 사례 에서 Adaboost와 SVM이 (SVM이 강력한 분류기 임에도 불구하고) 조화롭게 작동한다고 제안하는 논문을 읽었습니다 . 건축 및 프로그래밍 관점에서 그것들이 어떻게 작동하는지 파악할 수 없습니다. 나는 그들이 함께 어떻게 작동하는지 …

5
가설 정규 데이터에 대한 가설 검정을 수행 할 수 있습니까?
원래 데이터가 정상적으로 배포되었다고 생각한 데이터 모음이 있습니다. 그런 다음 실제로 그것을 보았고 데이터가 왜곡되어 있기 때문에 그렇지 않다는 것을 깨달았으며 샤피로 윌크스 테스트도했습니다. 통계 방법을 사용하여 분석하고 싶기 때문에 왜곡 정규성에 대한 가설 검정을 원합니다. 따라서 비대칭 성을 테스트하는 방법이 있는지, 가능하면 테스트를 수행하는 라이브러리가 있는지 알고 싶습니다.

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.