통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

3
2 차원 Kolmogorov-Smirnov
2 차원 분포가 기준에 맞는지 확인하기 위해 2 차원 Kolmogorov-Smironov 테스트를 실행하고 싶습니다. 비교적 간단한 방식으로 사용할 수있는 패키지 나 응용 프로그램이 있습니까? 아니면 다른 알고리즘이 선호됩니까? 기본적인 통계 지식이 있습니다.

2
청크 테스트 란 무엇입니까?
에 대한 질문에 대한 대답에서 다중 공선의 존재 모델 선택 , 프랭크 하렐은 제안 : 모든 변수를 모형에 넣지 만 경쟁 변수의 효과에 대해 조정 된 하나의 변수의 효과에 대해서는 테스트하지 않습니다 ... 경쟁 변수의 청크 테스트는 공선 변수가 전체 다중 자유도 연관 검정 대신 힘을 결합하기 때문에 강력합니다. 변수를 …

2
설문지에서 서수 데이터를 적절한 간격 데이터로 변환하는 방법은 무엇입니까?
서수 레벨 데이터를 간격 레벨로 변환 하는 간단한 방법이 있습니까 (다른 방법으로 수행하는 것처럼)? 그리고 Excel 또는 SPSS에서 수행 할 수 있습니까? 서수 수준에 대한 10 가지 질문 (예 : 0-5 척도, 0 = 전혀 아님), 5 = 항상 그렇습니다)을 가지고 데이터를 적절하게 취급 할 수 있도록 변환하고 싶습니다. 모수 …


3
통계 워크 벤치로서의 루비
이것은 또한 매우에 관한 질문 워크 벤치 통계 파이썬 과 통계가 작업대로 엑셀 . Ruby와 Python에 대해 큰 토론이 있다는 것을 알고 있지만 이것이이 질문의 핵심은 아닙니다. 루비가 파이썬보다 빠르며 구문이 매우 자연 스럽기 때문에 통계를 이해하는 데 도움이 될 수 있으며 R에 대한 좋은 대안이 될 수 있다고 생각 …
13 r  python  software  ruby 


2
중요도 샘플링으로 생성 된 Monte Carlo 추정치 결과
지난 1 년 동안 중요도 샘플링을 상당히 밀접하게 진행해 왔으며 도움을 받기를 희망하는 몇 가지 개방형 질문이 있습니다. 중요도 샘플링 체계에 대한 나의 실제 경험은 때때로 환상적인 저 분산 및 저 바이어스 추정을 생성 할 수 있다는 것입니다. 그러나 표본 분산이 적지 만 치우침이 매우 높은 오류 예측이 더 자주 …

3
randomForest에 대한 올바른 sampSize를 결정하기위한 공식 또는 규칙이 있습니까?
randomForest를 가지고 놀고 있는데 일반적으로 sampSize를 늘리면 성능이 향상됩니다. 최적의 sampSize가 무엇인지 제안하는 규칙 / 공식 / 등이 있습니까? 아니면 시행 착오입니까? 나는 그것을 표현하는 또 다른 방법을 추측한다; 너무 작은 sampSize 또는 너무 큰 (과적 합) 위험은 무엇입니까? 이 질문은 randomForest패키지 에서 임의 포리스트의 R 구현을 나타 냅니다. 이 …
13 r  random-forest 

2
비율 분석
최대 1을 더하는 여러 비율을 포함하는 데이터 집합이 있습니다. 그래디언트를 따라 이러한 비율을 변경하는 데 관심이 있습니다 (데이터 예는 아래 참조). gradient <- 1:99 A1 <- gradient * 0.005 A2 <- gradient * 0.004 A3 <- 1 - (A1 + A2) df <- data.frame(gradient = gradient, A1 = A1, A2 …
13 r  multinomial 

3
AR (1)은 Markov 프로세스입니까?
와 같은 AR (1) 프로세스 가 Markov 프로세스입니까?yt=ρyt−1+εtyt=ρyt−1+εty_t=\rho y_{t-1}+\varepsilon_t 그렇다면 VAR (1)은 Markov 프로세스의 벡터 버전입니까?


6
개별 회귀는 중요하지만 VIF는 낮을 때의 다중 공선 성
를 예측하는 데 사용하는 6 개의 변수 ( )가 있습니다. 데이터 분석을 수행 할 때 먼저 다중 선형 회귀 분석을 시도했습니다. 이로부터 두 변수 만이 중요했다. 그러나 각 변수를 개별적으로 와 비교하는 선형 회귀 분석을 실행했을 때 하나를 제외한 모든 변수 가 유의미했습니다 ( 는 0.01 미만에서 0.001 미만). 이것은 …

3
임의 누락 (MAR) 구별 완전 누락 (MCAR)
나는이 두 가지를 여러 번 설명했다. 그들은 계속 내 두뇌를 요리합니다. '무작위로 누락'은 의미가 있으며 '완전히 누락으로'는 의미가 있습니다 ... '무작위로 누락'입니다. MAR이지만 MCAR이 아닌 데이터는 무엇입니까?


2
펄스 신경망이 애플리케이션에 사용되는 방식은 무엇입니까?
펄스 또는 스파이 킹 신경망은 생물학적 뉴런의 더 많은 막 역학을 통합하는데, 여기서 펄스는 다음 층으로 정보를 전달합니다. 뉴런은 예를 들어 백프로 프에서와 같이 반드시 동시에 "발화"할 필요는 없습니다. 그러나 머신 러닝 문제에 이러한 모델을 사용하는 것에 대한 장벽이있는 것 같습니다. 보다 생물학적으로 현실적인 모델을 사용하는 머신 러닝 전문가에게는 어떤 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.