통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
이변 량 이항 분포 시각화
질문 : 이변 량 이항 분포는 3 차원 공간에서 어떤 모양입니까? 다음은 다양한 매개 변수 값을 시각화하려는 특정 기능입니다. 즉, 엔엔n , 피1피1p_{1} 및 피2피2p_{2} 입니다. 에프( x1, x2) = n !엑스1! 엑스2!피엑스11피엑스22,엑스1+ x2= n ,피1+ p2= 1.에프(엑스1,엑스2)=엔!엑스1!엑스2!피1엑스1피2엑스2,엑스1+엑스2=엔,피1+피2=1.f(x_{1},x_{2}) = \frac{n!}{x_{1}!x_{2}!}p_{1}^{x_{1}}p_{2}^{x_{2}}, \qquad x_{1}+x_{2}=n, \quad p_{1}+p_{2}=1. 두 가지 제약 조건이 있습니다. 엑스1+ …


3
상호 작용은 회귀 상황에서만 유용합니까?
나는 항상 회귀의 맥락에서 상호 작용이라는 용어를 읽었습니다. knn 또는 svm과 같은 다른 모델과의 상호 작용도 고려해야합니까? 이 경우 , 100 또는 더 많은 기능을하고 있습니다 말 1000 명 유용한 상호 작용을 찾을 수있는 일반적인 방법이 무엇인지 관찰? 모든 조합을 사용해보십시오? 아니면 합당한 조합 만 사용합니까?505050100100100100010001000

4
분산 측정이 중심보다 직관적이지 않은 이유는 무엇입니까?
인간의 이해에는 분산의 개념을 직관적으로 파악하는 데 어려움이있는 것으로 보입니다. 좁은 의미에서 그 대답은 즉각적입니다. 제곱은 우리를 재귀적인 이해에서 멀어지게합니다. 그러나 문제를 나타내는 것은 단지 차이 일까요, 아니면 데이터에 퍼지는 전체 아이디어일까요? 우리는 범위 에서 피난처를 찾습니다또는 최소값과 최대 값을 표시하지만 실제 어려움을 피하고 있습니까? 평균 (모드 또는 중앙값)에서 중심, …

1
근사
나는 우연히 다음과 같은 가진 기사 (경제학)를 읽었습니다 .로그( E( X) )log⁡(E(X))\log(E(X)) ,로그( E( X) ) ≈ E( 로그( X) ) + 0.5 v a r ( 로그( X) )log⁡(E(X))≈E(log⁡(X))+0.5var(log⁡(X))\log(E(X)) \approx E(\log(X))+0.5 \mathrm{var}(\log(X)) X가 log-normal (내가 아는)이라면 저자는 정확하다고 말합니다. 내가 모르는 것은이 근사치를 도출하는 방법입니다. 나는 2 차 테일러 …

3
빈도에 대한 베이지안 추론 이전의 베타 접합체 이해
다음은 Bolstad의 베이지안 통계 소개 에서 발췌 한 것입니다 . 거기에있는 모든 전문가에게 이것은 사소한 것일 수 있지만 저자가 우리가 어떤 값에 대한 사후 확률을 계산하기 위해 통합을 수행 할 필요가 없다는 결론을 내릴 수 없습니다 . 나는 두 번째 표현 인 비례와 모든 용어의 유래를 이해합니다 ( likelihood x …


2
p- 값의 두 가지 정의 : 동등성을 증명하는 방법?
Larry Wasserman의 저서 인 All of Statistics 를 읽고 현재 p- 값에 대해 읽고 있습니다 (187 페이지). 먼저 몇 가지 정의를 소개하겠습니다 (견적). RRRβ(θ)=Pθ(X∈R)β(θ)=Pθ(X∈R)\beta(\theta)=P_{\theta}(X\in R)α=supθ∈Θ0β(θ)α=supθ∈Θ0β(θ)\alpha = \sup_{\theta\in\Theta_0}\beta(\theta)αα\alphaαα\alpha 이것은 기본적으로 라고 말합니다 . 크기는 I 형 오류의 "가장 큰"확률입니다. 값은 (I 인용)을 통해 정의됩니다.αα\alphappp 정의 2 모든 대해 거부 영역 대한 …


2
라틴 하이퍼 큐브 샘플링 무증상
나는 내가 일하고있는 문제에 대한 증거를 만들려고 노력하고 있으며 내가 만들고있는 가정 중 하나는 내가 샘플링 한 포인트 세트가 전체 공간에 밀집되어 있다는 것입니다. 실제로, 전체 샘플 공간에서 내 포인트를 얻기 위해 라틴 하이퍼 큐브 샘플링을 사용하고 있습니다. 샘플 크기가 되도록 라틴 하이퍼 큐브 샘플이 전체 공간에 걸쳐 밀도가 높은지 …

3
평균 및 표준 편차 만있는 플로팅 결과
이 평균 표와 리콜 점수의 표준 편차에 대한 관측치에 대한 적절한 플롯을 시각화하려고합니다. RecallControlMean37SD8ExperimentalMean21SD6ControlExperimentalMeanSDMeanSDRecall378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ \hline \end{array} 가장 좋은 방법은 무엇입니까? 막대 차트가 …

3
더 많은 요소가 존재할 때 항상 추출하는 것이 더 낫습니까?
주성분 분석과 달리 요인 분석 모델에 대한 솔루션이 반드시 내포 된 것은 아닙니다. 즉, 첫 번째 요소 만 추출 될 때와 첫 두 요소가 추출 될 때 첫 번째 요소의로드 (예 :)가 반드시 동일하지는 않습니다. 이를 염두에두고, 상관 관계가 높고 (내용에 대한 이론적 지식으로) 단일 요인에 의해 구동되어야하는 매니페스트 변수 …

1
첫 번째 k (임시) 모멘트를 사용하여 대략적인 PDF (예 : 밀도 추정)를 맞추는 방법은 무엇입니까?
데이터 세트의 (첫 번째) 순간을 추정 할 수 있고 밀도 함수의 추정을 생성하는 데 사용하려는 상황이 있습니다.kkk 나는 이미 Pearson 분포를 겪었 지만 처음 4 개 순간에만 의존한다는 것을 깨달았습니다 (가능한 순간 조합에 대한 제한이 있음). 또한 더 많은 가정을 사용하지 않을 때 유한 모멘트 집합이 특정 분포를 "막아 내기"에 …

1
비모수 부트 스트랩 p- 값 대 신뢰 구간
문맥 이것은이 질문 과 다소 유사 하지만 정확한 복제본이라고 생각하지 않습니다. 부트 스트랩 가설 검정을 수행하는 방법에 대한 지침을 찾는 경우 일반적으로 신뢰 구간에 경험적 분포를 사용하는 것이 좋지만 귀무 가설 아래 분포에서 부트 스트랩을 올바르게 부트해야 p- 값. 예를 들어,이에 대한 허용 대답을 참조 질문을 . 인터넷의 일반적인 검색은 …

1
성능 측면에서 단어 포함 알고리즘
약 6 천만 개의 문구를 벡터 공간 에 삽입하려고 시도하고 그 사이 의 코사인 유사성 을 계산 하려고합니다. 나는 유니 그램 CountVectorizer과 bigram을 생성하는 맞춤형 내장 토큰 화 기능과 함께 sklearn을 사용 하고 있습니다. 의미있는 표현을 얻으려면 행 수에서 선형으로 엄청난 수의 열을 허용해야합니다. 이로 인해 엄청나게 희소 행렬이 발생하여 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.