통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
R의 plot.stl에서 범위 막대 해석?
범위 막대가 plot.stl정확히 무엇을 의미 하는지 파악하는 데 어려움이 있습니다 . 나는이 질문에 대한 Gavin의 게시물을 발견하고 문서를 읽었으며 분해 된 구성 요소의 상대적 크기를 말하지만 여전히 어떻게 작동하는지 완전히 확신하지 못합니다. 예 : 데이터 : 작은 막대, 스케일 없음 계절 : 전체 막대, -0.6에서 0.2 범위의 스케일 범위 : …
13 r  time-series 

1
시계열에서 분석 단위 (집계 수준)를 어떻게 선택합니까?
시간의 모든 정밀도 수준에서 시계열의 관측치를 측정 할 수 있고 연구의 목표가 X와 Y의 관계를 식별하는 것이라면, 다른 집계보다 특정 집계 수준을 선택하기위한 경험적 정당성이 있습니까? 이론 및 / 또는 실제적인 한계에 기초하여 단순히 선택을 하는가? 이 주요 질문에 대한 세 가지 하위 질문이 있습니다. 더 작은 수준의 집계를 선택하기에 …

2
시각화가 데이터 변환을위한 충분한 근거가됩니까?
문제 예를 들어 각 매개 변수마다 다른 막대가있는 막대 그림과 y 축의 분산과 같이 30 개 매개 변수 각각에 의해 설명 된 분산을 플로팅하고 싶습니다. 그러나 분산은 아래 히스토그램에서 볼 수 있듯이 0을 포함하여 작은 값으로 치우칩니다. 변환 하면 작은 값 (아래 막대 그래프 및 막대 그래프)의 차이점을 쉽게 볼 …

2
이벤트 시간에 대한 불확실성을 가진 시계열의 이벤트에 대한 인터 레이터 신뢰성
시계열에서 이벤트를 식별하려고하는 여러 독립 코더가 있습니다.이 경우 대면 대화 비디오를보고 특정 비언어적 행동 (예 : 헤드 노드)을 찾고 각 시간과 범주를 코딩합니다. 행사. 이 데이터는 샘플링 속도가 높은 (30 프레임 / 초) 이산 시계열 또는 연속 시계열로 처리하기에 적당 할 수 있습니다. 인터-래터 신뢰도의 일부 측정 값을 계산하고 싶지만 …

3
로지스틱 회귀 (또는 다른 형태의 회귀)에서 비선형 성 테스트
로지스틱 회귀 분석의 가정 중 하나는 로짓의 선형성입니다. 일단 모델을 설치하고 실행하면 Box-Tidwell 테스트를 사용하여 비선형 성을 테스트합니다. 내 연속 예측 변수 (X) 중 하나가 비선형성에 대해 양성으로 테스트되었습니다. 다음에 무엇을해야합니까? 이것은 가정을 위반하므로 예측 변수 (X)를 제거하거나 비선형 변환 (X * X)을 포함해야합니다. 아니면 변수를 범주 형으로 변환합니까? 참조가 …


4
OR (홀수 비율)의 분포는 무엇입니까?
CI가 95 % (신뢰 간격) 인 "OR"을 제시하는 기사가 많이 있습니다. 기사에서 관찰 된 OR의 P 값을 추정하고 싶습니다. 이를 위해서는 OR 분포에 관한 가정이 필요합니다. 안전하게 배포 / 사용할 수있는 배포판은 무엇입니까?

1
가중 데이터를 사용한 2- 표본 T- 검정
각 표본이 T- 검정의 가정에 의해 준수되는 두 개의 독립 표본 간의 차이를 테스트하기 위해 2- 표본 T- 검정을 수행하려고합니다 (각 분포는 동일한 분산으로 정규 분포와 동일한 것으로 가정 할 수 있음) . 기본 2- 표본 T- 검정의 유일한 합병증은 데이터에 가중치가 부여된다는 것입니다. 가중 평균과 표준 편차를 사용하고 있지만 …
13 t-test 


4
데이터를 집계하고 분석하는 가장 좋은 방법
최근에 머신 러닝 및 데이터 분석을 가르치기 시작하면서 대규모 데이터 세트를 생성하고 쿼리해야 할 필요성에 직면했습니다. 전문적이고 개인적인 삶에서 수집 한 데이터를 수집하고 분석하고 싶지만 다음을 수행하는 가장 좋은 방법은 확실하지 않습니다. 이 데이터를 어떻게 저장해야합니까? 뛰어나다? SQL? ?? 초보자가이 데이터를 분석하기 시작하는 좋은 방법은 무엇입니까? 저는 전문 컴퓨터 프로그래머이므로 …


1
대용량 벡터에 서포트 머신을 사용할 수 있습니까?
SVM에 대한 제한된 지식으로 짧고 뚱뚱한 데이터 매트릭스 (많은 기능과 많은 인스턴스는 아님)에는 좋지만 빅 데이터에는 적합하지 않습니다.엑스엑스X 한 가지 이유는 커널 행렬 가 행렬 이라는 것을 이해합니다. 여기서 은 데이터의 인스턴스 수입니다. 우리가 100K 데이터라고 말하면, 커널 행렬 는 요소를 가지며 ~ 80G 메모리를 사용할 수 있습니다.케이케이Kn × n엔×엔n …

3
빅 데이터 설정을 위해 병렬 / 분산 방식으로 선형 회귀를 실행하는 방법은 무엇입니까?
데이터 크기가 너무 커서 시스템 클러스터에 저장 해야하는 매우 큰 선형 회귀 문제를 연구 중입니다. 모든 샘플을 하나의 단일 시스템 메모리 (디스크 포함)로 집계하기에는 너무 큽니다. 이 데이터를 회귀시키기 위해 병렬 접근 방식, 즉 각 개별 상자에서 회귀를 실행 한 다음 각 개별 베타 통계 (아마도 평균 또는 중앙값)를 기반으로 …

2
최적의 샘플 크기에 도달하기 전에 A / B 테스트를 중지하는 것이 왜 잘못입니까?
회사에서 A / B 테스트 결과 (웹 사이트 변형으로 실행)를 발표 할 책임이 있습니다. 우리는 한 달 동안 테스트를 실행하고 우리가 의미에 도달 (또는 의미가 오랜 시간 동안 테스트를 실행 한 후 도달하지 않은 경우 포기) 할 때까지, 지금 알아내는하고 뭔가가있다 일정한 간격의 p 값을 확인 잘못된 관행 . 나는 …

2
랜덤 변수와 랜덤 샘플의 차이점은 무엇입니까?
이 두 표현은 통계를 배울 때 많이 혼란 스러웠습니다. 그것들은 완전히 다른 것 같습니다. 무작위 표본은 반면, 무작위 인구에서 샘플을 채취하는 확률 변수가 실수로 실험의 모든 가능한 결과 세트를 매핑하는 기능과 같다. 나는 몇 가지 샘플을 그릴 경우, 말 , X 2 , X 3 및 X I ~ N …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.