통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A




1
선형 회귀 분석에서 독립 변수로 1을 합한 비율 해석
범주 형 변수 개념과 친숙성을 피하기 위해 한 수준을 기준선으로 맞출 수있는 각각의 더미 변수 코딩에 익숙합니다. 또한 이러한 모델의 모수 추정값을 해석하는 방법에 대해서도 잘 알고 있습니다. 기준선 범주를 기준으로 주어진 적합 수준의 범주 형 예측 변수에 대한 예상 결과 변화입니다. 내가 확실하지 않은 것은 1 에 비례하는 독립 …


2
Gower 거리는 이진 변수의 차이를 어떻게 계산합니까?
내 데이터 세트에 73 개의 샘플이있는 17 개의 숫자 및 5 개의 이진수 (0-1) 변수가 있습니다. 클러스터 분석을 실행해야합니다. Gower 거리는 변수가 혼합 된 데이터 세트에 대한 좋은 지표라는 것을 알고 있습니다. 그러나 Gower 거리가 이진 변수 간의 차이를 계산하는 방법을 이해할 수 없었습니다 . 유클리드 거리와 다르지 않은 것 …

1
각 코드 블록 전에 또는 프로젝트 당 한 번 시드를 설정 하시겠습니까?
결과를 재현 할 수 있도록 랜덤 시드를 설정하는 것이 표준 조언입니다. 의사 난수 그려로 씨가 고급 때문에 경우, 결과는 변경 될 수 있는 코드 조각이 추가 번호를 그립니다. 언뜻보기에 버전 제어는 메모 나 종이에 결과를 적어 놓았을 때 최소한 버전으로 돌아가서 버전을 재현 할 수 있기 때문에 이것에 대한 해결책으로 …

2
가우스 프로세스 이점
가우시안 프로세스의 이점과 관련된 혼란이 있습니다. 선형 함수가 데이터를 모델링하도록 정의한 간단한 선형 회귀와 비교하는 것을 의미합니다. 그러나 가우시안 프로세스에서 함수 분포를 정의한다는 것은 함수가 선형이어야한다는 것을 구체적으로 정의하지 않음을 의미합니다. 함수가 얼마나 매끄러 워야 하는가와 같은 기능을 정의하는 가우시안 함수 인 함수보다 우선 순위를 정의 할 수 있습니다. 따라서 …

2
RNA seq와 ChIP-chip 데이터 세트 사이의 유전자 목록 중복 가능성 계산
이 포럼의 누군가가 유전자 발현 연구에서이 기본적인 문제를 해결해 줄 수 있기를 바랍니다. 나는 실험 조직과 대조 조직의 깊은 시퀀싱을했다. 그런 다음 대조군보다 실험 샘플에서 유전자의 배수 농축 값을 얻었습니다. 기준 게놈에는 ~ 15,000 개의 유전자가 있습니다. 15,000 개 유전자 중 3,000 개가 대조군과 비교하여 관심있는 샘플에서 특정 컷오프 이상으로 …

1
배치 규범에 학습 가능한 규모와 변화가있는 이유는 무엇입니까?
내가 이해하는 한 배치 규범은 모든 입력 기능을 레이어의 정규 분포로 정규화합니다. 엔( μ = 0 , σ= 1 )엔(μ=0,σ=1)\mathcal{N}(\mu=0,\sigma=1). 평균 및 분산 는 현재 미니 배치에 대한 값을 측정하여 추정됩니다.μ ,σ2μ,σ2\mu, \sigma^2 정규화 후 입력은 스칼라 값으로 스케일링되고 이동됩니다. 엑스^'나는= γ엑스^나는+ β엑스^나는'=γ엑스^나는+β\hat{x}_i' = \gamma \hat{x}_i + \beta (여기서 내가 …

5
신경망 / 딥 러닝을 설계하고 적용하기위한 시각적 도구가 있습니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 9 개월 전 . 나는 caffe, Theano, TensorFlow, keras와 같은 머신 러닝과 딥 러닝을위한 많은 라이브러리가 있다는 것을 알고 있습니다. 그러나 저는 신경망의 아키텍처를 알고 싶어하는 것 …

2
Rubin의 인과 모델에 대한 논란 없음-Layman의 설명
Rubin의 인과 관계 모델을 구현할 때, 우리가 필요로하는 (가장 믿을 수없는) 가정 중 하나는 헷갈 리지 않는 것입니다. ( Y( 0 ) , Y( 1 ) ) ⊥ T| 엑스(Y(0),Y(1))⊥T|X(Y(0),Y(1))\perp T|X LHS가 반제품 인 경우, T는 처리이고 X는 우리가 제어하는 ​​공변량입니다. Rubin Causal Model에 대해 잘 모르는 사람에게 이것을 설명하는 …

2
의사 결정 트리의 범주 형 기능을 코딩하는 모범 사례?
선형 회귀 분석을 위해 범주 형 피쳐를 코딩 할 때 규칙이 있습니다. 더미의 수는 공선 성을 피하기 위해 총 레벨 수보다 하나 작아야합니다. 의사 결정 트리에 대해 비슷한 규칙이 있습니까 (태그, 부스트)? 파이썬의 표준 연습은 n레벨을 n인형 (sklearns ' OneHotEncoder또는 Pandas' pd.get_dummies) 으로 확장 하여 저에게 최적이 아닌 것처럼 보이기 …

1
랜덤 포레스트 부분 의존도 플롯에서 y 축의 의미
나는 RandomForestR 패키지를 사용하고 있으며 부분 의존도에서 Y 축의 값을 해석하는 방법에 혼란스러워합니다. 도움말 문서에 따르면 줄거리는 "클래스 확률에 대한 변수의 한계 효과에 대한 그래픽 묘사"입니다. 그러나 나는 y 축이 정확히 무엇을 나타내는 지 여전히 혼란 스럽습니다. 특히 음수 값은 무엇을 의미합니까? 클래스를 정확하게 예측하는 데 부정적인 영향을 미친다는 것은 …

1
Metropolis-Hastings 알고리즘이있는 MCMC : 제안 선택
3 매개 변수 함수의 적분을 평가하기 위해 시뮬레이션을 수행해야합니다. 에프ff매우 복잡한 수식이 있습니다. MCMC 방법을 사용하여 계산하고 Metropolis-Hastings 알고리즘을 구현하여에프ff제안 분포로 3 가지 변이 법선을 사용하는 것이 좋습니다. 그것에 대한 몇 가지 예를 읽으면, 일부는 고정 매개 변수 와 함께 정규 변수를 사용하고 일부는 변수 평균 와 함께 사용하는 것을 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.