통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

5
일련의 입력에 대해 어떤 통계적 분류 알고리즘이 참 / 거짓을 예측할 수 있습니까?
일련의 입력이 주어지면이 시퀀스에 원하는 특정 속성이 있는지 확인해야합니다. 이 속성은 true 또는 false 만 가능합니다. 즉 시퀀스에 속할 수있는 클래스는 두 개뿐입니다. 시퀀스와 속성 간의 정확한 관계는 불분명하지만, 이것이 매우 일관되고 통계적 분류에 적합하다고 생각합니다. 분류기를 훈련시키는 사례가 많이 있지만,이 훈련 세트에서 시퀀스에 잘못된 클래스가 할당 될 가능성이 약간 …



2
베이 즈 정리에서 상수 정규화
나는 Bayes 규칙에서 분모 Pr(data)Pr(data)\Pr(\textrm{data}) 의 Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)\Pr(\text{parameters} \mid \text{data}) = \frac{\Pr(\textrm{data} \mid \textrm{parameters}) \Pr(\text{parameters})}{\Pr(\text{data})} 정규화 상수 라고합니다 . 정확히 무엇입니까? 그 목적은 무엇입니까? 왜 처럼 보 Pr(data)Pr(data)\Pr(data)입니까? 왜 매개 변수에 의존하지 않습니까?

4
가설 검정에서 귀무 가설을 지정하는 방법
귀무 가설에 대한 문제를 선택하는 방법에 대한 경험적 규칙은 무엇입니까? 예를 들어 가설 B가 참인지 확인하려면 B를 널로, B를 대립 가설로, NOT B를 널로 사용해야합니까? 질문이 명확하기를 바랍니다. 최소화하려는 오류 (유형 I?)와 관련이 있다는 것을 알고 있지만 명확한 직관이 없기 때문에 진행 방식을 잊어 버립니다. 감사.

4
R에서 관측치 및 / 또는 예측 변수를 추가 할 때 선형 회귀를 효율적으로 업데이트
관측치 또는 예측 변수를 추가 할 때 선형 모델을 효율적으로 업데이트하기 위해 R에서 방법을 찾는 데 관심이 있습니다. biglm에는 관측치를 추가 할 때 업데이트 기능이 있지만 내 데이터는 메모리에 상주 할 정도로 작습니다 (업데이트 할 인스턴스가 많지만). QR 인수 분해 업데이트 (예 : Hammarling 및 Lucas의 "QR 인수 분해 및 …

5
베이지안보다 확률이 더 높습니까?
물리학을 전공 한 학생으로서 저는“왜 베이지안인가?”강의를 약 6 번 정도 경험했습니다. 발표자는 항상 동일하다. 발표자는 베이지안 해석이 대중에 의해 사용 된 잦은 해석보다 우수하다는 것을 잘 설명한다. 그들은 베이 즈의 규칙, 소외, 이전과 후부를 언급합니다. 실제 이야기는 무엇입니까? 잦은 통계에 대한 적법한 적용 영역이 있습니까? (확실히 여러 번 다이를 샘플링하거나 …

4
올가미에 대한 최적의 페널티 선택
ℓ 1 페널티 항 계수의 최적 선택에 관한 분석 결과 또는 실험 논문이 있습니까? 하여 최적의 , 나는 최고의 모델, 또는 최소화 예상 손실을 선택하는 확률을 극대화 매개 변수를 의미한다. 문제의 인스턴스 수가 많거나 문제의 크기 때문에 교차 유효성 검사 또는 부트 스트랩으로 매개 변수를 선택하는 것이 실용적이지 않기 때문에 …

2
낮은 이벤트 비율로 로지스틱 회귀 적용
이벤트 속도가 매우 낮은 데이터 세트가 있습니다 ( 중 40,000 ). 로지스틱 회귀를 적용하고 있습니다. 나는 로지스틱 회귀가 그러한 낮은 이벤트 레이트 데이터에 대해 좋은 혼란 매트릭스를 제공하지 않는다는 사실을 알게 된 사람과 토론을했습니다. 그러나 비즈니스 문제와 정의 방법으로 인해 이벤트 수를 40,000에서 더 큰 수로 늘릴 수는 없지만 일부 …
15 logistic 

2
변수 파티션의 분산을 계산하는 방법
나는 (독립적 인) 샘플을 병렬로 수집하는 실험을 실행하고 있으며 각 샘플 그룹의 분산을 계산 한 다음 모든 샘플을 합하여 모든 샘플의 총 분산을 찾고 싶습니다. 용어가 확실하지 않기 때문에 이에 대한 파생물을 찾는 데 어려움을 겪고 있습니다. 나는 그것을 하나의 RV의 파티션으로 생각합니다. 따라서 , , ... 및 에서 를 …
15 variance 

3
CDF가 힘을 얻었습니까?
경우 FZFZF_Z CDF, 그것과 같다 FZ(z)αFZ(z)αF_Z(z)^\alpha ( α>0α>0\alpha \gt 0 )뿐만 아니라 CDF이다. Q : 이것이 표준 결과입니까? Q : 함수를 찾는 좋은 방법이 있는가 ggg 과 X≡g(Z)X≡g(Z)X \equiv g(Z) 일 FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alpha , 여기서 x≡g(z)x≡g(z) x \equiv g(z) 기본적으로, 나는 또 다른 CDF, FZ(z)αFZ(z)αF_Z(z)^\alpha 있습니다. 일부 축소 된 …


3
클러스터링의 데이터 출력을 플롯하는 방법은 무엇입니까?
데이터 세트 (마크 세트)를 클러스터링하려고 시도하고 2 개의 클러스터를 얻었습니다. 그래픽으로 표현하고 싶습니다. (x, y) 좌표가 없기 때문에 표현에 대해 약간 혼란 스럽습니다. 또한 MATLAB / Python 함수를 찾고 있습니다. 편집하다 데이터를 게시하면 질문이 더 명확 해집니다. 파이썬에서 kmeans 클러스터링을 사용하여 만든 두 개의 클러스터가 있습니다 (scipy를 사용하지 않음). 그들은 …

2
R의 확장 된 Dickey Fuller 테스트의 지연 이해
케이케이kadf.test케이케이k Dickey-Fuller = -3.9828, Lag order = 4, p-value = 0.01272 alternative hypothesis: stationary # 103^(1/3)=k=4 Dickey-Fuller = -2.7776, Lag order = 0, p-value = 0.2543 alternative hypothesis: stationary # k=0 Dickey-Fuller = -2.5365, Lag order = 6, p-value = 0.3542 alternative hypothesis: stationary # k=6 PP 테스트 결과와 함께 …
15 r  time-series  trend 

1
"Heywood Case"의 정확한 정의는 무엇입니까?
나는 "Heywood Case"라는 용어를 다소 비공식적으로 사용하여 온라인의 '유한 응답'반복적으로 업데이트 된 분산 추정치가 수치 정밀도 문제로 인해 부정적으로 된 상황을 언급했습니다. (데이터를 추가하고 오래된 데이터를 제거하기 위해 Welford 방법의 변형을 사용하고 있습니다.) 수치 오류나 모델링 오류로 인해 분산 추정치가 마이너스가 된 상황에 적용되었다는 인상을 받았지만 동료는 이 용어를 사용하면서 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.