통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
오 탐지 횟수를 줄이는 방법은 무엇입니까?
보행자 감지 라는 작업을 해결하려고 노력하고 있으며 사람, 부정-배경이라는 두 가지 범주의 긍정적 인 이진 clasifer를 훈련시킵니다. 데이터 세트가 있습니다. 긍정 수 = 3752 음수 = 3800 train \ test split 80 \ 20 % 및 RandomForestClassifier 양식 scikit-learn 을 매개 변수와 함께 사용합니다. RandomForestClassifier(n_estimators=100, max_depth=50, n_jobs= -1) 점수를 얻습니다 …

1
왜 매번 강력한 회귀를하지 않는가?
이 페이지의 예는 단순 회귀가 특이 치에 의해 크게 영향을받는 것으로 나타 났으며 이는 강력한 회귀 기술로 극복 할 수 있습니다 : http://www.alastairsanderson.com/R/tutorials/robust-regression-in-R/ . 나는 lmrob와 ltsReg가 다른 강력한 회귀 기술이라고 생각합니다. 왜 단순 회귀 (lm)를 수행하지 않고 매번 강력한 회귀 (rlm 또는 rq)를 수행하지 않아야합니까? 이러한 강력한 회귀 기술의 …

2
주어진 반응 변수에 대한 최적의 비닝
주어진 응답 (목표) 이진 변수와 최대 간격 수를 매개 변수로 사용하여 연속 변수의 최적 비닝 방법 (분화)을 찾고 있습니다. 예 : 나는 "높이"(숫자 연속)와 "has_back_pains"(이진) 변수를 가진 사람들에 대한 관찰 결과를 가지고 있습니다. 나는 허리 통증이있는 ​​사람들의 다른 비율로 최대 높이를 3 간격 (그룹)으로 이산화하고 싶습니다. 그래서 알고리즘이 그룹 간의 …


2
회귀 모형의 VC 차원
강의 시리즈 Learning from Data 에서 교수는 VC 차원이 주어진 모델이 산산이 부서 질 수있는 지점의 모델 복잡성을 측정한다고 언급합니다. 따라서 분류 기가 k 점을 효과적으로 산산조각 할 수있는 경우 N 점 중 VC 차원 측정 값이 K가 될 수있는 분류 모델에 완벽하게 작동합니다. 그러나 회귀 모형에 대한 VC 차원을 …

1
정규화와 래그 레인지 멀티 플라이어 방법 사이의 연결은 무엇입니까?
과적 합을 피하기 위해 사람들 은 선형 회귀의 비용 함수에 정규화 매개 변수 와 함께 정규화 용어 (모델의 매개 변수의 제곱합에 비례)를 추가합니다 . 이 매개 변수 는 lagrange multiplier와 동일합니까? 정규화는 lagrange multiplier 방법과 동일합니까? 아니면이 방법들은 어떻게 연결되어 있습니까? λλλ\lambdaλλ\lambda

2
올바른 검열을 통해 완구 생존 (이벤트 시간) 데이터를 생성하는 방법
올바른 검열을 받고 비례 위험과 일정한 기준 위험으로 일부 분포를 따르는 완구 생존 (이벤트 시간) 데이터를 작성하려고합니다. 다음과 같이 데이터를 만들었지 만 Cox 비례 위험 모델을 시뮬레이션 된 데이터에 적용한 후 실제 값에 가까운 예상 위험 비율을 얻을 수 없습니다. 내가 뭘 잘못 했어? R 코드 : library(survival) #set parameters …

2
두 개의 독립적 인 균일 랜덤 변수의 곱의 pdf
하자 ~ 및 ~ 주어진 분포와 두 개의 독립적 인 확률 변수합니다. 의 분포는 무엇입니까 ?XXXU(0,2)U(0,2)U(0,2)YYYU(−10,10)U(−10,10)U(-10,10)V=XYV=XYV=XY 나는 그것을 알고 회선을 시도했다 h(v)=∫y=+∞y=−∞1yfY(y)fX(vy)dyh(v)=∫y=−∞y=+∞1yfY(y)fX(vy)dyh(v) = \int_{y=-\infty}^{y=+\infty}\frac{1}{y}f_Y(y) f_X\left (\frac{v}{y} \right ) dy 또한 , fY(y)=120fY(y)=120f_Y(y) = \frac{1}{20} H(V)=1h(v)=120∫y=10y=−101y⋅12dyh(v)=120∫y=−10y=101y⋅12dyh(v)= \frac{1}{20} \int_{y=-10}^{y=10} \frac{1}{y}\cdot \frac{1}{2}dy h ( v ) = 140∫와이= 10와이= − 101와이디와이h(v)=140∫y=−10y=101ydyh(v)=\frac{1}{40}\int_{y=-10}^{y=10} \frac{1}{y}dy 0에 …

1
키가 큰 직사각형 행렬에 의한 랜덤 변수의 선형 변환
확률 밀도 함수 가있는 분포에서 추출한 랜덤 벡터 이 있다고 가정하겠습니다 . 우리가 그것을 풀 랭크 행렬 로 선형 변환하여 를 얻는 다면, 의 밀도는 의해 주어집니다X⃗ ∈RnX→∈Rn\vec{X} \in \mathbb{R}^nfX⃗ (x⃗ )fX→(x→)f_\vec{X}(\vec{x})n×nn×nn \times nAAAY⃗ =AX⃗ Y→=AX→\vec{Y} = A\vec{X}Y⃗ Y→\vec{Y}fY⃗ (y⃗ )=1|detA|fX⃗ (A−1y⃗ ).fY→(y→)=1|detA|fX→(A−1y→). f_{\vec{Y}}(\vec{y}) = \frac{1}{\left|\det A\right|}f_{\vec{X}}(A^{-1}\vec{y}). 이제 \ vec …



2
순위 데이터 (Spearman correlation)에 대한 회귀선을 그리는 것이 "괜찮아"입니까?
Spearman 상관 관계를 계산 한 데이터가 있으며이를 게시 용으로 시각화하려고합니다. 종속 변수는 순위가 매겨지고 독립 변수는 순위가 매겨지지 않습니다. 시각화하려는 것은 실제 기울기보다 일반적인 추세이므로 독립성을 평가하고 Spearman 상관 관계 / 회귀를 적용했습니다. 그러나 데이터를 플로팅하고 원고에 삽입하려고 할 때이 웹 사이트 에서이 내용을 우연히 발견했습니다 . Spearman 순위 상관 …

4
강화 학습에 관한 교과서
강화 학습에서 교과서 / 강의 노트를 찾고 있습니다. 나는 "통계 학습 입문"을 좋아 하지만 불행히도이 주제를 다루지 않습니다. 나는 Sutton과 Barto의 저서가 표준 참고 자료이며 아마도 NDP 도 좋지만 1997-98 년 날짜였으며이 분야가 최근에 꽤 발전 할 가능성이 있기 때문에 더 현대적인 설명을 찾고자했습니다. 시각.

3
단위 볼에서 N 샘플의 원점에 가장 가까운 중간 값에 대한 공식 설명
에서는 통계 학습 요소 , 문제는 고차원 공간에서 K-NN으로 하이라이트 문제로 도입된다. 거기 균일하게 분포되어 데이터 포인트 차원 부 공.P엔NN피pp 원점에서 가장 가까운 데이터 포인트까지의 중간 거리는 다음 식으로 제공됩니다. 디( p , N) = ( 1 − ( 12)1엔)1피d(p,N)=(1−(12)1N)1pd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} 때 가장 가까운 지점으로 국경에 접근하는 방법, 볼의 …

2
패널 데이터를위한 기계 학습 알고리즘
이 질문에서- 구조적 / 계층 적 / 다단계 예측 변수를 고려한 의사 결정 트리를 구성하는 방법이 있습니까? -그들은 나무에 대한 패널 데이터 방법을 언급합니다. Vector Machines 및 Neural Networks를 지원하기위한 특정 패널 데이터 방법이 있습니까? 그렇다면 알고리즘 및 구현 가능한 경우 R 패키지에 대한 몇 가지 논문을 인용 할 수 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.