통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
대각선을 가로 지르는 ROC 곡선
현재 이진 분류기를 실행하고 있습니다. ROC 곡선을 플롯하면 처음에 좋은 리프트를 얻은 다음 방향이 바뀌고 대각선을 교차 한 다음 다시 위로 올라가 곡선을 기울어 진 S 모양으로 만듭니다. 이 효과에 대한 해석 / 설명은 무엇입니까? 감사
12 roc 


3
높은 비선형 기능을 맞추기위한 전략
생물 물리학 실험의 데이터를 분석하기 위해 현재는 매우 비선형 모델로 커브 피팅을 시도하고 있습니다. 모델 함수는 기본적으로 다음과 같습니다. y=ax+bx−1/2y=ax+bx−1/2y = ax + bx^{-1/2} 여기서 특히 의 가치 는 큰 관심을 끌고 있습니다.bbb 이 함수에 대한 도표 : (모델 함수는 시스템에 대한 철저한 수학적 설명을 기반으로하며 매우 잘 작동하는 것처럼 …

1
혼합 모형에 대한 조정 표기법
나는 다음과 같은 표기법에 익숙하다. 여기서β0J=β0+UJ및와이나는 j= β0+ β나는엑스나는 j+ u제이+ 전자나는 j= β0 j+ β나는엑스나는 j+ 전자나는 jyij=β0+βixij+uj+eij=β0j+βixij+eij\begin{align} y_{ij} &= \beta_0 + \beta_i x_{ij} + u_j + e_{ij}\\ &= \beta_{0j} + \beta_i x_{ij} + e_{ij} \end{align}β0 j= β0+ u제이β0j=β0+uj\beta_{0j}=\beta_{0}+u_j 여기서β0J=β0+U0J및β1J=β(1)+U(1)J와이나는 j= β0+ β1엑스나는 j+ u0 j+ u1 개 j엑스나는 …

1
테니스 경기가 하나의 대형 세트라면, 같은 정확도를 제공하는 게임은 몇 개입니까?
테니스는 독특한 3 계층 점수 시스템을 가지고 있으며, 이것이 더 나은 선수를 결정하기위한 실험으로서의 경기 관점에서 통계적 이점이 있는지 궁금합니다. 익숙하지 않은 사람들을 위해, 일반적인 규칙에서 게임은 당신이 2 포인트 리드를 가지고있는 한 (즉, 4-2라면이기는하지만 4-3은 1 포인트 더 필요하며, 계속 유지합니다) 한 명의 선수가 2 명 앞서야합니다. 세트는 게임의 …



2
시리즈를 정지시키기 위해 추이와 차이를 만들 수 있습니까?
시간이 지남에 따라 데이터 세트가 명확하게 증가하고 있습니다 (통화의 환율, 20 년 동안의 월간 데이터). 내 질문은 : 데이터를 추론하고 그 자체로 추이를 낮추면 고정시킬 수 있도록 데이터를 추론 할 수 있습니까? 이것을 달성하지 못합니까? 그렇다면 두 번의 차이로 간주됩니까, 아니면 단지 한 번의 차이로 간주됩니까?

3
상관 관계 또는 결정 계수가 회귀선을 따르는 값의 백분율과 관련이 있습니까?
상관 관계 은 두 변수 사이의 선형 연관성 척도입니다. 결정 계수 는 한 변수의 변수가 다른 변수의 "설명"에 의해 얼마나 설명 될 수 있는지를 측정 한 것입니다.r 2아르 자형rr아르 자형2r2r^2 예를 들어, 이 두 변수 사이의 상관 경우 입니다. 따라서 한 변수의 64 %가 다른 변수의 차이로 설명 될 수 …

1
Stata에서 계측 된 상호 작용 항으로 도구 변수 회귀 분석을 수행하는 방법은 무엇입니까?
Stata 구문에 약간의 문제가 있습니다. 다음과 같은 회귀 분석을 수행해야합니다. y=ax+bz+c(xz)+ey=ax+bz+c(xz)+ey = ax + bz + c(xz) + e 여기서 와 모두 계측되고 상호 작용 항 는 계측 된 및 값을 사용합니다 .xxxzzzxzxzxzxxxzzz 및 대해 예측 된 값을 생성하고 이를 회귀 변수로 사용하면 잘못된 표준 오류가 발생합니다.xxxzzz 편집 : 또한 …

2
충분한 통계는 무엇입니까?
충분한 통계를 이해하는 데 어려움이 있습니까? 하자 충분한 통계합니다.T=ΣxiT=ΣxiT=\Sigma x_i 경우 확률 1로, 어떤 기능에 대한 , 그것은 전체 충분한 통계치이다.E[g(T)]=0E[g(T)]=0E[g(T)]=0ggg 그러나 이것이 무엇을 의미합니까? 유니폼과 Bernoulli (페이지 6 http://amath.colorado.edu/courses/4520/2011fall/HandOuts/umvue.pdf )의 예를 보았지만 직관적이지 않으므로 통합을 보는 것이 더 혼란스러워졌습니다. 누군가 간단하고 직관적 인 방법으로 설명 할 수 있습니까?

2
기능 수를 늘리면 성능이 저하되는 이유는 무엇입니까?
기능 수를 늘리면 성능이 저하 될 수있는 이유에 대한 직관을 얻으려고합니다. 현재 LDA 분류기를 사용하고 있습니다.이 기능은 특정 기능 사이에서 이변 형이 더 우수하지만 더 많은 기능을 볼 때 더 나쁩니다. 분류 정확도는 계층화 된 10 배 xval을 사용하여 수행됩니다. 분류자가이 높은 차원에서 일어나고있는 것에 대한 물리적 또는 공간적 직관을 …


1
비계 절화 카운트 데이터
R에서 stl ()을 사용하여 카운트 데이터를 추세, 계절 및 불규칙 구성 요소로 분해했습니다. 결과 트렌드 값은 더 이상 정수가 아닙니다. 다음과 같은 질문이 있습니다. stl ()이 카운트 데이터를 비계 절화하는 적절한 방법입니까? 결과 추세가 더 이상 값을 가지지 않으므로 lm ()을 사용하여 추세 구성 요소를 모델링 할 수 있습니까?


당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.