통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
신경망의 VC 치수 계산
나는와 시그 모이 뉴런의 일부 고정이 아닌 재발 (DAG) 토폴로지 (노드와 가장자리의 고정 세트하지만, 학습 알고리즘은 가장자리에 무게를 다를 수 있음)이있는 경우 단지에서 문자열을 할 수있는 입력 뉴런 { - 1 , 1 } n 을 입력으로하여 하나의 출력으로 이어집니다 (실제 값은 0에서 멀어지고 특정 고정 임계 값 인 경우 …


2
신경망 안정성을 개선하려면 어떻게합니까?
R의 신경망을 사용하여 14 개의 입력과 하나의 출력으로 NN을 구축하고 있습니다. 동일한 입력 교육 데이터와 동일한 네트워크 아키텍처 / 설정을 사용하여 네트워크를 여러 번 빌드 / 트레이닝합니다. 각 네트워크가 생성 된 후 독립 테스트 데이터 세트에서이를 사용하여 일부 예측 값을 계산합니다. 네트워크를 구축 할 때마다 모든 입력 (훈련 데이터 및 …

2
혼합 효과 모델과의 상호 작용 항에 대한 사후 비교를 수행하는 방법은 무엇입니까?
퇴적 미생물 활동에 대한 건조의 영향을 평가하기 위해 데이터 세트를 작업 중입니다. 건조의 영향이 퇴적물 형태 및 / 또는 퇴적물 내 깊이에 따라 달라지는지를 결정하는 것이 목적입니다. 실험 설계는 다음과 같습니다. 첫 번째 요소 퇴적물 은 세 가지 유형의 퇴적물 (코드화 된 Sed1, Sed2, Sed3)에 해당합니다. 각 유형의 퇴적물에 대해, …

4
시계열의 예측 성 평가
1 월 5 일에서 12 월 11 일까지 20.000 개가 넘는 월별 시계열이 있다고 가정합니다. 이들 각각은 다른 제품에 대한 글로벌 판매 데이터를 나타냅니다. 각각의 예측을 계산하는 대신 "실제로 중요한"소수의 제품에만 집중하고 싶을 경우 어떻게해야합니까? 나는 총 연간 수입으로 해당 제품의 순위를 매기고 고전적인 파레토를 사용하여 목록을 정리할 수 있습니다. …

1
지니 계수 및 오차 한계
각 시점에서 N = 14 카운트의 시계열 데이터가 있으며 각 시점 에서이 추정치에 대한 Gini 계수 및 표준 오류를 계산하려고합니다. 각 시점에서 N = 14 카운트 만 있기 때문에 jackknife 분산을 계산하여 진행했습니다. 즉 톰슨 Ogwang의 식 (7)로부터표준 오차 '지니 인덱스와를 계산하는 편리한 방식'. 여기서G는(N,K는)요소없이 N 값 지니 계수K와 ˉ …


2
간단한 선형 회귀 분석 결과 : 어떤 정보를 포함해야합니까?
방금 Genstat에서 (아주) 간단한 선형 회귀를 수행했으며 보고서에 간결하고 의미있는 결과 요약을 포함하고 싶습니다. 정확히 어떤 정보를 포함해야하는지 잘 모르겠습니다. 내 Genstat 출력의 주요 비트는 다음과 같습니다. Summary of analysis Source d.f. s.s. m.s. v.r. F pr. Regression 1 8128935. 8128935. 814.41 <.001 Residual 53 529015. 9981. Total 54 8657950. …

1
사람들이 왜“증거 가중치”라는 용어를 사용하고“포인트 상호 정보”와 다른 점은 무엇입니까?
여기서 "증거의 무게"(WOE)는 출판 된 과학 및 정책 결정 문헌에서 일반적으로 사용되는 용어로, 다음과 같이 정의 된 위험 평가와 관련하여 가장 자주 나타납니다. w(e:h)=logp(e|h)p(e|h¯¯¯)w(e:h)=log⁡p(e|h)p(e|h¯)w(e : h) = \log\frac{p(e|h)}{p(e|\overline{h})} 여기서 증거이며, 가설이다.시간eeehhh 이제 PMI와의 주요 차이점 (포인트 별 상호 정보)을 알고 싶습니다. pmi(e,h)=logp(e,h)p(e)∗p(h)pmi(e,h)=log⁡p(e,h)p(e)∗p(h)pmi(e,h)=\log\frac{p(e,h)}{p(e)*p(h)}


2
R에서 요인에서 숫자 변수로 변환하는 중 문제 발생
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 칠년 전에 . 요인 변수를 숫자로 변환하고 싶지만 as.numeric기대 효과가 없습니다. 아래는 원래 변수를 기반으로 한 숫자 버전의 변수에 대한 요약 통계를 얻습니다. 수단은 1까지 계속 카운트합니다 …

2
상관 계수 비교
78 및 35 샘플에 대해 ~ 250.000 값을 갖는 두 개의 데이터 세트가 있습니다. 일부 샘플은 패밀리의 구성원이므로 데이터에 영향을 줄 수 있습니다. 페어 와이즈 상관 관계를 계산했으며 0.7과 0.95 사이에서 다양하지만 상관 계수가 인트라 대 패밀리간에 유의 한 차이가 있는지 알고 싶습니다. 가장 좋은 방법은 무엇입니까? 감사



1
GLM에 어떤 종류의 잔차와 쿡 거리가 사용됩니까?
쿡의 거리 공식이 무엇인지 아는 사람이 있습니까? 원래 Cook의 거리 공식은 학생 화 된 잔차를 사용하지만 R이 표준을 사용하는 이유는 무엇입니까? GLM에 대한 Cook의 거리 플롯을 계산할 때 Pearson 잔차가 발생합니다. 학생 화 된 잔차가 GLM에 대해 정의되지 않았지만 Cook의 거리를 계산하는 공식은 어떻게 생겼습니까? 다음 예제를 가정하십시오. numberofdrugs <- …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.