통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
머신 러닝의 기능 구성 및 표준화
영화 M에 대한 물류 분류기를 만들고 싶다고 가정 해 보겠습니다. 내 특징은 사람의 나이, 성별, 직업, 위치와 같은 것입니다. 훈련 세트는 다음과 같습니다. 연령 성별 직업 위치 좋아요 (1) / 싫음 (0) 23 M 소프트웨어 미국 1 24F 닥터 영국 0 등등 .... 이제 내 질문은 어떻게 기능을 확장하고 표현해야 …

2
연속 시간 종 이진 반응을위한 R 패키지가 있습니까?
이 bild패키지는 직렬 이진 응답을위한 훌륭한 패키지 인 것으로 보입니다. 그러나 별개의 시간이다. 나는 이전에 측정 된 이진 반응 또는 적어도 이것의 1 차 Markov 버전으로 현재 응답 Y의 승산 비 연결에 매끄러운 시간 함수를 지정하고 싶습니다. 이것을 이것을 로지스틱 로지스틱 회귀라고합니다. 누구든지 연속 시간을 처리하는 R 패키지를 알고 있습니까? …

2
R의 확률 미분 방정식에 대한 수치 솔버가 있습니까?
나는 Euler-Maruyama 체계, Milstein 체계 (또는 다른 것)를 사용하여 (1)과 같은 비균질 비선형 확산으로부터 경로를 시뮬레이션하기위한 일반적이고 깨끗하고 빠른 (즉, C ++ 루틴 사용) R 패키지를 찾고 있습니다. 이것은 더 큰 추정 코드에 포함되어야하므로 최적화 될 가치가있다. 디엑스티= f( θ , t , X티)디t + g( θ , t , …

1
샘플을 부트 스트랩 할 때 센터링이 필요합니까?
표본 평균의 분포를 근사하는 방법에 대해 읽을 때 비모수 적 부트 스트랩 방법을 사용했습니다. 분명히 의 분포에 의해 의 분포를 근사 할 수 있습니다 . 여기서 는 표본 평균을 나타냅니다. 부트 스트랩 샘플. ˉ X ∗ n − ˉ X n ˉ X ∗ n엑스¯엔− μX¯n−μ\bar{X}_n-\mu엑스¯※엔− X¯엔X¯n∗−X¯n\bar{X}_n^*-\bar{X}_n엑스¯※엔X¯n∗\bar{X}_n^* 내 질문은 : …

2
p> n 인 경우 올가미는 최대 n 개의 변수를 선택합니다.
탄력적 그물의 동기 중 하나는 다음과 같은 LASSO의 한계였습니다. 에서 경우로 인해 볼록 최적화 문제의 본질 올가미 최대 선택 변수 N 그것을 전에 포화된다. 이것은 변수 선택 방법에 대한 제한 기능인 것 같습니다. 또한, 계수의 L1- 노름에 대한 경계가 특정 값보다 작지 않으면 올가미가 잘 정의되지 않습니다.p > np>np > …

1
최적화 문제
내 친구가 개의 블렌더 모델을 판매 합니다. 일부 블렌더는 매우 간단하고 저렴하며, 다른 블렌더는 매우 정교하고 비싸다. 그의 데이터는 매월 각 블렌더의 가격 (그가 정한)과 각 모델의 판매 단위 수로 구성됩니다. 어떤 표기법을 확립하기 위해, 그는 몇 달 동안 벡터 여기서 는 개월 동안 블렌더 모델 의 가격 , 는 …

1
선형 회귀 및 공간 자기 상관
원격 감지를 통해 얻은 일부 변수를 사용하여 특정 지역의 나무 높이를 예측하고 싶습니다. 대략적인 바이오 매스 등과 같이 먼저 선형 회귀를 사용하고 싶습니다 (최상의 아이디어는 아니지만 프로젝트의 필수 단계 임). 공간 자기 상관이 얼마나 심하게 영향을 미칠 수 있는지 그리고 가능한 경우이를 수정하는 가장 쉬운 방법이 무엇인지 알고 싶었습니다. 그건 …

1
부트 스트래핑이 중앙값 추정의 불확실성을 평가하는 유효한 방법입니까?
부트 스트랩은 평균 추정치의 불확실성에 접근하는 데 효과적이지만 부트 스트랩이 정량적 추정치 (특히 중앙값)의 불확실성을 평가하는 데 좋지 않은 곳을 읽는 것을 기억합니다. 어디서 읽었는지 기억이 나지 않으며 빠른 Google 검색으로 많은 것을 찾을 수 없었습니다. 이것에 대한 생각과 참조는 대단히 감사하겠습니다.


5
임시 데이터에 적합한 클러스터링 기술?
활동 빈도에 대한 일시적인 데이터가 있습니다. 비슷한 활동 수준으로 뚜렷한 기간을 나타내는 데이터에서 클러스터를 식별하고 싶습니다. 이상적으로 는 사전에 클러스터 수를 지정 하지 않고 클러스터를 식별하고 싶습니다 . 적절한 클러스터링 기술은 무엇입니까? 질문에 대답 할 정보가 충분하지 않은 경우 적절한 클러스터링 기술을 결정하기 위해 제공해야하는 정보는 무엇입니까? 아래는 제가 상상하고있는 …

1
신생 대사 유도. 붙어
따라서이 질문은 다소 관여하지만 가능한 한 간단하게 노력하려고 노력했습니다. 목표 : 간단히 말해서, 고차 누적을 포함 하지 않는 부조화의 유도가 있으며 , 그것이 어떻게 도출되었는지 이해하려고합니다. 배경 : (이 모든 것을 이해합니다) 나는 여기에있는 '독립 구성 요소 분석' 책을 스스로 연구하고 있습니다. (이 질문은 '비 다항식 함수에 의한 엔트로피의 근사'책이있는 …

3
PCA의 구성 요소가 실제로 분산의 백분율을 나타 냅니까? 100 % 이상으로 합산 할 수 있습니까?
O'Reilly의 "해커를위한 기계 학습"에 따르면 각 주요 구성 요소는 분산의 백분율을 나타냅니다. 아래 페이지의 관련 부분을 인용했습니다 (8 장, 207 페이지). 다른 전문가와 이야기하면서, 그들은 그것이 백분율이라고 동의했습니다. 그러나 24 개 구성 요소의 합계는 133.2095 %입니다. 어떻게 그렇게 될수 있니? 우리가 PCA를 사용할 수 있다고 확신 한 후에 R에서 어떻게 …
13 r  pca 

3
덩어리의 표준 측정?
나는 많은 데이터를 가지고 있으며 매우 간단한 것처럼 보이고 싶다. 이 대규모 데이터 세트에서 특정 요소가 얼마나 많이 모여 있는지에 관심이 있습니다. 내 데이터가 {A, C, B, D, A, Z, T, C ...}와 같이 정렬 된 세트라고 가정하겠습니다. A가 세트 전체에 무작위로 (또는 더 고르게) 분포되는 것과는 대조적으로, A가 서로 …

5
회귀 분석의 종속 변수로 백분율 추정
저는 38 개의 시험에서 학생의 순위 비율이 제 연구의 종속 변수입니다. 순위 비율은 (시험에서 학생의 순위 / 학생 수)에 의해 계산됩니다. 이 종속 변수는 분포가 거의 균일하며 일부 변수가 종속 변수에 미치는 영향을 추정하고 싶습니다. 어떤 회귀 접근법을 사용합니까?

2
다중 회귀 분석에서 값을 사용하여 선형성 가정을 테스트하려면 어떻게해야합니까?
아래 그래프는 "정규성", "균등성"및 "독립성"가정이 이미 충족 된 회귀 테스트의 잔차 산점도입니다! "선형성" 가정을 테스트하기 위해 그래프를 보면 관계가 곡선 적이라고 추측 할 수 있지만 문제는 다음과 같습니다. "R2 선형"값을 사용하여 선형성 가정을 테스트 할 수 있습니까? 관계가 선형인지 여부를 결정하기 위해 "R2 선형"값의 허용 범위는 무엇입니까 ? 선형성 가정이 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.