통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
n-gram은 어떤 n에서 비생산적인가?
자연어 처리를 할 때, 코퍼스를 취하고 n의 순서로 다음 단어가 발생할 확률을 평가할 수 있습니다. n은 일반적으로 2 또는 3 (bigrams 및 trigrams)으로 선택됩니다. 해당 수준에서 특정 모음을 한 번 분류하는 데 걸리는 시간을 고려할 때 n 번째 체인에 대한 데이터 추적이 비생산적인 것으로 알려진 시점이 있습니까? 또는 (데이터 구조) …

2
계통 발생 의존 변수 : ANOVA?
나는 계통 발생 데이터에서 공분산 행렬을 도출 하여 회귀를 만드는 두 변수 에 대해 을 만드는 것을 이해합니다. 그러나 이전에 계통 발생에 의존하는 것으로 보이는 연속 변수가 하나 있고 순서 변수가 하나 인 경우 어떻게됩니까? 후자는 서수이므로 이것을 계통 발생 의존성이 편향된 테스트 통계로 만드는 방식과 어떻게 관련이 있는지 잘 …
13 anova  phylogeny 

1
생일 질문에 대한 실제 답변은 무엇입니까?
"동일한 생일을 가진 두 사람을 찾을 확률을 50 % 이상으로하려면 수업이 얼마나 커야합니까?" 페이스 북에 360 명의 친구가 있는데, 예상대로 생일 분포가 일정하지 않습니다. 나는 같은 생일을 가진 9 명의 친구가있는 어느 날이 있습니다. (큰 공휴일과 발렌타인 데이가 큰 것은 9 개월이 지난 것 같습니다.) 따라서, 며칠이 생일에 더 가능성이 …

1
바이오 마커 연구를위한 검정력 계산 / 샘플 크기
환자에게 암이 있는지 여부를 예측할 수있는 잠재적 인 바이오 마커가 있습니다. 바이오 마커 시험 결과는 이진이 양성 또는 음성이다. 우리는이 바이오 마커가 좋은 예측 인자인지 아닌지를 결정하기 위해 검사를 받아야하는 환자의 양을 어느 정도 이해하려고합니다. 인터넷에서 읽을 때가는 방법은 감도 (사례 수)와 특이성 (컨트롤 수)을 보는 것 같습니다. 이 상황을 …
13 r  power 

2
Johansen 공적분 테스트를 수행 할 때 지연을 선택하는 올바른 절차는 무엇입니까?
2 개의 시계열 (간단한 경우)에 대해 Johansen Cointegration 테스트를 수행 할 때 사용하려는 지연을 결정해야합니다. 다른 지연에 대한 테스트를 수행하면 다른 결과가 반환됩니다. 일부 지연 수준의 경우 귀무 가설을 기각 할 수는 있지만 다른 경우에는 그렇지 않습니다. 내 질문은 입력 데이터를 기반으로 Johansen 테스트를 수행 할 때 사용해야하는 지연을 결정하는 …


5
n Bernoulli 시행의 연속에서 k 개의 성공 가능성
25 회 시도 블록에서 8 회 연속으로 시도 할 확률을 찾으려고 노력하고 있습니다 .8 회 시도 (25 회 시도)에서 총 8 회 시도하여 연속으로 8 회 시도합니다. 추측에 근거하여 시행 착오를 얻을 확률은 1/3이며, 행 수 행에서 8을 얻은 후에 블록이 종료됩니다 (따라서 행 수 행에서 8 이상을 얻는 것은 …


2
중첩되지 않은 모델 선택
우도 비 검정과 AIC는 두 모델 중에서 선택하기위한 도구이며 모두 로그 우도를 기반으로합니다. 그러나 왜 우도 비 검정을 사용하여 중첩되지 않은 두 가지 모델 중에서 AIC를 선택할 수 없습니까?

2
데이터 샘플이 감마 분포 제품군에 적합한 지 테스트하는 방법은 무엇입니까?
연속 랜덤 변수 X에서 생성 된 데이터 샘플이 있습니다. R을 사용하여 그린 막대 그래프에서 X의 분포가 특정 감마 분포를 따르는 것 같습니다. 그러나 나는이 감마 분포의 정확한 매개 변수를 모른다. 내 질문은 X 분포가 감마 분포 군에 속하는지 테스트하는 방법입니다. Kolmogorov-Smirnov 검정, Anderson-Darling 검정 등과 같은 적합도 검정이 있지만 이러한 …


2
토비트 모델 설명
두 그룹에 100 명의 참가자가 있습니다. n = 50n=50n=50각 그룹에서. 우리는 4 가지 시점에서 기본 기능의 능력에 대한 평가를 사용했습니다. 평가는 6 개의 문항으로 구성되며, 각 문항은 0 – 5 점입니다. 각 문항에 대한 개별 점수는 없으며 0 – 30 범위의 총 점수 만 있습니다. 점수가 높을수록 더 잘 기능합니다. …

3
변수가 다른 경우 일반적인 회귀 분석 vs. 회귀 분석
변수가 다를 때 정상적인 다중 / 단순 회귀와 다중 / 단순 회귀 사이의 관계가 무엇인지 이해하려고합니다. 예를 들어, 예금 잔고 ( )와 시장 요율 ( ) 사이의 관계를 분석하고 있습니다. 간단한 선형 회귀 분석을 실행하면 상관 관계가 음수이고 상당히 중요합니다 (-.74 정도). 그러나 로그를 가져 오면 종속 변수의 차이와 독립 …

4
임상 시험에 대한 원시 데이터는 어디에서 찾을 수 있습니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 2 년 전 . 마스터 학생들의 연말 시험을 위해 임상 시험에 대한 원시 데이터를 사용하고 싶습니다. 이러한 데이터는 시험이 완료되는 한 (1 단계에서 4 단계까지) 모든 종류의 …

2
통계적 유의성 테스트를 사용하여 군집 분석 결과 검증
클러스터 분석 결과를 검증하기 위해 통계적 유의성 테스트 (SST) 사용을 조사하고 있습니다. 이 주제와 관련하여 다음과 같은 여러 논문을 발견했습니다. " 높은 차원, 낮은 표본 크기 데이터에 대한 클러스터링의 통계 유의 사항 Fi를 cance 에 의해" 리우, Yufeng의 등. (2008) " 군집 분석의 일부 유의성 검정에서 ", Bock (1985) 그러나 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.