통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
로지스틱 회귀 분석에서 확률 비에 대한 신뢰 구간을 생성하는 다양한 방법
로지스틱 회귀에서 얻은 계수에서 승산 비에 대한 95 % 신뢰 구간을 구성하는 방법을 연구하고 있습니다. 로지스틱 회귀 모형을 고려하면 log(p1−p)=α+βxlog⁡(p1−p)=α+βx \log\left(\frac{p}{1 - p}\right) = \alpha + \beta x \newcommand{\var}{\rm Var} \newcommand{\se}{\rm SE} 되도록 대조군 및 의 경우의 그룹.x=0x=0x = 0x=1x=1x = 1 나는 가장 간단한 방법은 대해 95 % CI를 …

3
이벤트 간의 상관 관계를 찾기 위해 어떤 알고리즘을 사용할 수 있습니까?
기계 학습에 익숙하지 않아서 몇 가지 문헌을 찾으려고 노력하고 있지만 Google에 어떤 내용이 있는지 잘 모르겠습니다. 내 데이터는 다음과 같은 형식입니다. User A performs Action P User B performs Action Q User C performs Action R ... User C performs Action X User A performs Action Y User B performs …

5
자동화 된 기계 학습은 꿈입니까?
머신 러닝을 발견하면 다음과 같은 흥미로운 기술이 나타납니다. 자동 같은 기법 튜닝 알고리즘 grid search, 동일한 "유형"의 서로 다른 알고리즘을 조합하여보다 정확한 결과를 얻을 수 있습니다 boosting. 서로 다른 알고리즘 (동일한 유형의 알고리즘은 아님)의 조합을 통해보다 정확한 결과를 얻을 수 있습니다 stacking. 아마 더 많은 것을 여전히 발견해야 할 것입니다 …

2
“무료 점심 정리”는 일반 통계 테스트에 적용됩니까?
내가 일하고 있던 한 여성이 일부 데이터에 대해 일원 분산 분석을 수행하도록 요청했습니다. 나는 데이터가 반복 측정 (시계열) 데이터이며 독립성에 대한 가정이 위반되었다고 생각했다. 그녀는 가정에 대해 걱정하지 말고 시험 만하면 가정이 충족되지 않았 음을 고려할 것이라고 대답했다. 그것은 나에게 옳지 않은 것처럼 보였다. 나는 몇 가지 조사를했고, 데이비드 로빈슨이 …


2
음수 값을 로그로 변환하는 방법은 무엇입니까?
Log()이 분산 데이터가 있으므로 음수 값을로 변환하는 방법을 알고 싶습니다 . 수식에서 작동한다는 것을 읽었 Log(x+1)지만 데이터베이스에서는 작동하지 않으며 결과적으로 NaN을 계속 얻습니다. 예를 들어이 경고 메시지가 나타납니다 (음수 값 중 하나를 사용하면 예를 보여주기에 충분하다고 생각하기 때문에 전체 데이터베이스를 넣지 않았습니다). > log(-1.27+1) [1] NaN Warning message: In log(-1.27 …
12 r  logarithm 

2
동전을 던지는 것이 그룹을 두 그룹으로 무작위로 분류하는 공정한 방법입니까?
그래서 저와 제 삼촌은 동전 던지기가 정말로 무작위인지 여부에 대해 논쟁을하고 있습니다. 실제 용어로 동전 던지기가 항상 동전을 조작하므로 결과가 50/50이 아니기 때문에 임상 시험에서 그룹을 할당하기위한 무작위 배정 기술로 적합하지 않다고 주장합니다. 그러나 그는 동전 던지기의 불완전한 결함이 무작위성을 생성한다고 주장합니다. 그래서 그는 영원히 공정한 동전을 던질 수 있고 …

1
사람들이 MLP와 함께 더 깊은 RBF 또는 RBF를 사용하지 않는 이유는 무엇입니까?
따라서 Radial Basis Function Neural Networks를 볼 때 사람들은 1 숨겨진 레이어의 사용을 권장하는 반면 멀티 레이어 퍼셉트론 신경 네트워크에서는 더 많은 레이어가 더 나은 것으로 간주됩니다. RBF 네트워크가 역 전파 버전으로 훈련 될 수 있다고 가정하면 더 깊은 RBF 네트워크가 작동하지 않거나 RBF 레이어를 깊은 MLP 네트워크에서 두 번째 …

1
자동 키워드 추출 : 코사인 유사성을 기능으로 사용
나는 문서 용어 행렬 을 가지고 있으며 이제 감독 학습 방법 (SVM, Naive Bayes, ...)을 사용하여 각 문서의 키워드를 추출하고 싶습니다. 이 모델에서는 이미 Tf-idf, Pos 태그를 사용합니다 ...미디엄MM 그러나 지금 나는 다음에 대해 궁금합니다. 용어 사이에 코사인 유사성 이있는 행렬 가 있습니다.씨CC 이 유사성을 내 모델의 기능으로 사용할 가능성이 …

1
베이지안 모델 선택의 Jeffreys-Lindley 역설에 대해 언제 걱정해야합니까?
RJMCMC를 사용하여 탐색하는 다양한 복잡성 모델의 넓은 (그러나 유한 한) 공간을 고려하고 있습니다. 각 모델의 매개 변수 벡터에 대한 사전 정보는 상당히 유익합니다. 더 복잡한 모델 중 하나가 더 적합 할 때 간단한 모델을 선호하는 Jeffreys-Lindley 역설 에 대해 어떤 경우에 걱정해야 합니까? 베이지안 모델 선택에서 역설의 문제를 강조하는 간단한 …

1
밀도 플롯을 해석하는 방법
밀도 플롯의 높이를 어떻게 해석해야합니까? 예를 들어 위의 그림에서 피크는 x = 18에서 약 0.07입니다. 값의 약 7 %가 약 18이라고 추론 할 수 있습니까? 그보다 더 구체적으로 설명 할 수 있습니까? 높이가 0.02 인 x = 30에서 두 번째 피크도 있습니다. 값의 약 2 %가 30 정도라는 것을 의미합니까? …

2
왜 단어 대신 텍스트 언어 식별에 n-gram이 사용됩니까?
널리 사용되는 두 가지 언어 식별 라이브러리 인 C ++ 용 Compact Language Detector 2와 Java 용 언어 탐지기 에서 둘 다 (문자 기반) n-gram을 사용하여 텍스트 기능을 추출했습니다. 단어 백 (한 단어 / 사전)이 사용되지 않는 이유는 무엇입니까? 단어 백과 n- 그램의 장점과 단점은 무엇입니까? 또한 텍스트 분류에서 n-grams …

3
확률의 수렴에 대하여
보자 {Xn}n≥1{Xn}n≥1\{X_n\}_{n\geq 1} 확률 변수 일 수 시퀀스 Xn→aXn→aX_n \to a 확률에서 a&gt;0a&gt;0a>0 고정 상수이다. 나는 다음을 보여 주려고 노력하고있다 : Xn−−−√→a−−√Xn→a\sqrt{X_n} \to \sqrt{a} 와 aXn→1aXn→1\frac{a}{X_n}\to 1 둘 다 확률입니다. 나는 나의 논리가 건전한 지보기 위해 왔습니다. 여기 내 작품이 있습니다 시도 첫 번째 부분은 |Xn−−−√−a−−√|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn−−−√+a−−√|=ϵ|(Xn−−−√−sqrta)+2a−−√||Xn−a|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn+a|=ϵ|(Xn−sqrta)+2a||\sqrt{X_n}-\sqrt{a}|<\epsilon \impliedby |X_n-a|<\epsilon|\sqrt{X_n}+\sqrt{a}|=\epsilon|(\sqrt{X_n}-sqrt{a})+2\sqrt{a}| ≤ϵ|Xn−−−√−a−−√|+2ϵa−−√&lt;ϵ2+2ϵa−−√≤ϵ|Xn−a|+2ϵa&lt;ϵ2+2ϵa\leq \epsilon|\sqrt{X_n}-\sqrt{a}|+2\epsilon\sqrt{a}<\epsilon^2+2\epsilon\sqrt{a} …

1
N 정상 iid 제품의 대략적인 분포? 특수한 경우 μ≈0
을 감안할 때 IID , 그리고 찾고 :N≥30N≥30N\geq30Xn≈N(μX,σ2X)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μX≈0μX≈0\mu_X \approx 0 정확한 닫힌 형태 분포 근사 YN=∏1NXnYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} 동일한 제품의 점근 적 ( 지수 ?) 근사 이것은 일반적인 질문 인 의 특별한 경우 입니다.μX≈0μX≈0\mu_X \approx 0

1
가능한 모든 쌍을 사용하여 정규 혼합 분포를 만드는 밀도 추정 방법의 이름은 무엇입니까?
나는 단지 하나의 차원 밀도 추정값을 생성하는 깔끔한 (필수는 아니지만) 방법을 생각했으며 내 질문은 다음과 같습니다. 이 밀도 추정 방법에는 이름이 있습니까? 그렇지 않다면, 그것은 문헌에서 다른 방법의 특별한 경우입니까? 방법은 다음과 같습니다. 우리는 벡터 가지고 있는데 우리가 추정하고자하는 알려지지 않은 분포에서 나온 것으로 가정합니다. 이를 수행하는 방법은 에서 가능한 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.