통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

4
일 변량 로지스틱 회귀 분석을위한 표본 크기 계산
피험자들의 코호트가 수술 시점에 단일 연속 변수를 측정 한 다음 2 년 후에 기능적 결과 또는 손상된 결과로 분류되는 연구에 필요한 표본 크기를 어떻게 계산합니까? 측정 결과 나쁜 결과를 예측할 수 있었는지 확인하고 싶습니다. 어떤 시점에서 우리는 연속 변수에서 컷 포인트를 도출하여 그 결과가 손상 될 가능성을 줄이기 위해 개입하려고 …

3
P, LSD, MSD, HSD, CI를 SE로 변환하기위한 이러한 공식이 의 정확하거나 부풀려진 / 보수적 인 추정값으로 맞습니까?
배경 이전에 게시 된 데이터가 포함 된 메타 분석을 수행하고 있습니다. 종종, 치료 간의 차이는 P- 값, 최하위 차이 (LSD) 및 기타 통계로보고되지만 분산의 직접적인 추정치는 제공하지 않습니다. 내가 사용하는 모델과 관련하여 과대 평가의 분산은 괜찮습니다. 문제 다음은 제가 고려하고 있는 (Saville 2003)의 로의 변환 목록입니다 . 아래에서는 이므로 이며 …

3
일관성 검사 란 무엇입니까?
나는 "일일 작업에서 일관성 검사를 했습니까?"와 같은 질문을 받았습니다. Biostatistician 입장을위한 전화 인터뷰 중. 무엇을 대답해야할지 모르겠습니다. 모든 정보를 부탁드립니다.
11 validation 

3
첨도에 영향을주지 않고 왜곡을 변화시키는 변형?
첨도에 영향을 미치지 않고 임의 변수의 왜곡을 변경하는 변환이 있는지 궁금합니다. 이것은 RV의 아핀 변환이 평균과 분산에 어떻게 영향을 미치나, 왜도 및 첨도에는 영향을 미치지 않는 것과 유사합니다 (부분적으로는 삐와 첨도는 규모의 변화에 ​​불변으로 정의되기 때문에). 이것은 알려진 문제입니까?

3
스파이크가없는 잘린 가우스 곡선의 평균 및 표준 편차 추정
평균 m 및 표준 편차 s를 갖는 정규 분포에 따라 데이터를 생성하는 블랙 박스가 있다고 가정합니다. 그러나 값이 0보다 작은 값을 출력 할 때마다 아무 것도 기록하지 않는다고 가정하십시오 (이러한 값이 출력되었음을 알 수 없음). 급격한 가우시안 분포가 있습니다. 이 매개 변수를 어떻게 추정 할 수 있습니까?

2
R에서 정렬 된 범주 형 데이터 간의 상관 관계를 시각적으로 신속하게 평가합니까?
설문 조사에서 다른 질문에 대한 답변 사이의 상관 관계를 찾고 있습니다 ( "음, 11 번 질문에 대한 답변이 78 번 질문에 대한 답변과 관련이 있는지 살펴 보겠습니다"). 모든 답변은 범주 형 (대부분 "매우 불행"에서 "매우 행복"까지)이지만 일부 답변에는 다른 답변이 있습니다. 대부분은 서수로 간주 될 수 있으므로이 경우를 고려해 보겠습니다. …

6
n- 점 리 커트 척도 데이터를 이항 공정에서 n 번의 시행으로 취급하는 것이 적절합니까?
나는 이러한 가정이 적어도 극한의 범위에서 위반 될 것이라는 합리적인 기대가있을 때 사람들이 리 커트 척도의 데이터를 오류가 연속적이고 가우시안 인 것처럼 일반적으로 분석하는 방법을 결코 좋아하지 않았습니다. 다음 대안에 대해 어떻게 생각하십니까? 응답 값을 취하면 온 N'- 포인트 스케일로 데이터 확장 시험, 값 1이있는 따라서 0의 값을 가지고있는을 우리가 …

6
R의 data.frame에서 모든 고유 요인 조합에 대한 요약 통계를 찾는 방법은 무엇입니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 2 년 전 . data.frame에서 요인의 각 고유 조합에 대해 data.frame에서 변수 요약을 계산하려고합니다. plyr를 사용해야합니까? apply ()와 반대로 루프를 사용하는 것이 좋습니다. 각 고유 한 조합을 …

6
프로젝트 오일러 문제 213 (“벼룩 서커스”)에 어떻게 접근해야합니까?
프로젝트 오일러 213 을 해결하고 싶지만 통계 분야의 평신도이기 때문에 어디서부터 시작 해야할지 모르겠습니다. 정확한 답변이 필요하므로 Monte Carlo 방법이 작동하지 않습니다. 읽을 수있는 몇 가지 통계 주제를 추천 해 주시겠습니까? 여기에 솔루션을 게시하지 마십시오. 벼룩 서커스 30x30 크기의 정사각형 격자에는 900 개의 벼룩이 있으며, 처음에는 사각형 당 한 개의 …

6
관찰 (즉, 비 랜덤 화) 연구에서 비 독립적 공변량을 제어하는 ​​것이 얼마나 문제가됩니까?
Miller and Chapman (2001)은 관찰 (비 랜덤 화되지 않은) 연구에서 독립 변수와 종속 변수 둘 다와 관련된 비 독립 공변량을 제어하는 ​​것은 절대적으로 부적절하다고 주장합니다. 그렇게하는 것이 얼마나 문제가됩니까? 이 문제를 처리하는 가장 좋은 방법은 무엇입니까? 자신의 연구에서 관측 연구에서 비 독립적 공변량을 일상적으로 관리한다면 어떻게 정당화 할 수 있습니까? …

4
다중 카이-제곱 검정
2 x 2 x 6 테이블에서 교차 분류 된 데이터가 있습니다. 하자가 치수를 호출 response, A하고 B. 로지스틱 회귀 분석을 모형이있는 데이터에 적합합니다 response ~ A * B. 해당 모형의 이탈도 분석에 따르면 항과 교호 작용이 모두 중요합니다. 그러나 데이터의 비율을 살펴보면 2 개 정도의 수준만 B이 중요한 영향을 미치는 …

5
연구 계획 방법에 대한 참조
통계에 대한 평균 (중간 값?) 대화에서이 데이터 나 해당 유형의 데이터를 분석하는이 방법 또는 해당 방법을 논의하는 경우가 종종 있습니다. 내 경험상 통계 분석과 관련하여 특별한 생각을 가진 신중한 연구 설계는 종종 무시됩니다 (생물학 / 생태학에서 일하는 경우가 보편적 인 것으로 보입니다). 통계 학자들은 종종 수집 된 데이터가 불충분 한 …

4
비 독립적 관측치가있는 분산 분석
이 질문에 대한 자세한 배경 지식으로 죄송합니다. 때때로 동물 행동에 대한 조사에서 실험자는 피험자가 시험 장치에서 미리 정의 된 다른 영역에서 보내는 시간에 관심이 있습니다. 나는 종종 이런 종류의 데이터가 ANOVA를 사용하여 분석되는 것을 보았습니다. 그러나 ANOVA는 관측치가 독립적이라고 가정하고 이러한 분석에서 실제로 독립적이지 않다는 점을 고려할 때 이러한 분석의 …
11 anova 

1
이진 데이터에 대한 분산 분석을 어떻게 적용 할 수 있습니까?
n 개의 과목에 대해 이진 결과 변수 (예 : 졸업 후 고용 상태, 1 = 고용, 0 = 실업)를 예측하는 데 사용하는 4 가지 경쟁 모델이 있습니다. 모델 성능의 자연 메트릭은 적중률이며 이는 각 모델에 대한 정확한 예측의 백분율입니다. 데이터가 분산 분석의 기본 가정을 위반하므로이 설정에서 분산 분석을 사용할 수없는 …

1
방법 선택을위한 좋은 프레임 워크는 무엇입니까?
방법 선택을위한 이론적 프레임 워크 (주 : 모델 선택이 아님)를 조사해 왔으며 체계적이고 수학적으로 동기 부여 된 작업이 거의 발견되지 않았습니다. '방법 선택'이란 문제 또는 문제 유형과 관련하여 적절한 (또는 더 나은 최적의) 방법을 구별하기위한 프레임 워크를 의미합니다. 내가 발견 한 것은 단편적 인 경우 특정 방법과 해당 튜닝 (즉, …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.