통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
다중 선형 회귀 분석에서 p- 값 이해
다중 선형 회귀 분석의 p- 값과 관련하여 Minitab 웹 사이트 의 소개 는 아래와 같습니다. 각 항에 대한 p- 값은 계수가 0 (영향 없음)이라는 귀무 가설을 검정합니다. 낮은 p- 값 (<0.05)은 귀무 가설을 기각 할 수 있음을 나타냅니다. 다시 말해, p- 값이 낮은 예측 변수는 예측 변수 값의 변화가 반응 …

2
시끄러운 사인파에 대한 확률 분포
측정 오류가있을 때 진동 함수에서 샘플링 지점의 확률 분포를 분석적으로 계산하려고합니다. 나는 "노이즈없이"부분의 확률 분포를 이미 계산했지만 (이 부분을 마지막에 넣겠습니다) "노이즈"를 포함하는 방법을 알 수 없습니다. 수치 추정 더 명확하게 말하면, 단일 사이클 동안 무작위로 포인트를 선택하는 함수가 있다고 상상해보십시오 . 히스토그램에 점을 비우면 분포와 관련이 있습니다.와이( x ) …

2
두 순위 알고리즘을 비교하는 방법은 무엇입니까?
두 순위 알고리즘을 비교하고 싶습니다. 이 알고리즘에서 고객은 검색시 몇 가지 조건을 지정합니다. 고객의 요구 사항에 따라이 알고리즘은 데이터베이스의 각 항목에 대한 점수를 할당하고 가장 높은 점수를 가진 항목을 검색해야합니다. 이 사이트에서 내 질문과 관련된 다른 주제를 읽었으며 인터넷을 검색했습니다. 내 검색에 따르면 순위 알고리즘을 비교하기위한 일부 메트릭에 대해 설명하는 …

5
릿지 및 LASSO 규범
이 게시물은 다음과 같습니다. 왜 대각선에 상수를 추가하여 능선 추정치가 OLS보다 좋습니까? 내 질문은 다음과 같습니다. 내가 아는 한, 능선 정규화는 -norm (유클리드 거리)을 사용합니다. 그러나 왜 우리는이 표준의 제곱을 사용합니까? ( 직접 적용 하면 베타 합의 제곱근이 발생합니다).ℓ2ℓ2\ell_2ℓ2ℓ2\ell_2 비교 , 우리는 LASSO에 대해 이것을하지 않습니다. LASSO는 -norm을 사용 하여 …

2
다단계 요인이있는 모형에 적합하려면 왜 R이 오래 걸립니까?
여러 수준의 요인이있는 모델에 적합하며 해당 모델에 적합하려면 R이 실제로 오랜 시간이 걸립니다. 왜 이런거야? 예를 들어, 플레이어의 급여를 예측하기 위해 회귀 분석을 적용하고 모든 플레이어의 각 국적에 대한 요인 예측 변수를 포함시키는 경우 플레이어의 급여에 대한 모델을 플레이어의 연속 예측 변수와 맞추는 것보다 시간이 오래 걸립니다. 높이.




1
드리프트가있는 시리즈와 추세가있는 시리즈의 차이점
드리프트가있는 시리즈는 로 모델링 할 수 있습니다. 여기서 는 드리프트 (일정한)이고 입니다. 와이티= c + ϕ yt - 1+ ε티yt=c+ϕyt−1+εty_t = c + \phi y_{t-1} + \varepsilon_t씨ccϕ = 1ϕ=1\phi=1 추세가있는 시리즈는 로 모델링 할 수 있습니다. 여기서 는 드리프트 (일정한), 는 결정적인 시간 추세 및 입니다.와이티= c + δt + …

1
우도 비 검정의 규칙 성 조건은 무엇입니까
가능성 비율 테스트의 점근 적 분포에 대한 규칙 성 조건이 무엇인지 알려주시겠습니까? 내가 보는 모든 곳에서 '정기 조건 아래'또는 '확률 규칙에 따라'라고 쓰여 있습니다. 조건은 정확히 무엇입니까? 제 1 및 제 2 로그 우도 미분이 존재하고 정보 매트릭스가 0이 아닌가? 아니면 다른 것이 있습니까?

2
서수와 연속 랜덤 변수 사이의 비강도 연관 강도 측정
내가받은 문제를 여기에 던지고 있습니다. 두 개의 임의 변수가 있습니다. 하나는 연속적 이며 (Y) 다른 하나는 이산 적이며 서수 (X) 로 접근 합니다. 쿼리와 함께받은 줄거리 아래에 넣었습니다. 데이터를 보낸 사람 은 X와 Y 사이 의 연관 강도 를 측정 하려고합니다 . 데이터를 생성 한 프로세스에 대한 가정이 먼저 나오지 …

1
공간 상관도에서 U 자형 패턴의 원인은 무엇입니까?
나는 내 자신의 연구 에서 다양한 거리에서 공간적 상관 관계를 조사 할 때이 패턴이 상관 관계에서 U 자형 패턴이 나타나는 것을 알았습니다 . 보다 구체적으로, 작은 거리 빈에서 강한 양의 상관 관계는 거리에 따라 감소한 다음 특정 지점에서 구덩이에 도달 한 후 다시 올라갑니다. 다음은 Conservation Ecology 블로그, Macroecology playground …

1
PR에 대해 하나의 값만있을 때 Precision-Recall 곡선을 형성하는 방법은 무엇입니까?
콘텐츠 기반 이미지 검색 시스템을 만드는 데이터 마이닝 할당이 있습니다. 5 마리의 동물 이미지가 20 개 있습니다. 총 100 개의 이미지가 있습니다. 내 시스템은 가장 관련성이 높은 10 개의 이미지를 입력 이미지로 반환합니다. 이제 Precision-Recall 곡선으로 시스템 성능을 평가해야합니다. 그러나 Precision-Recall 곡선의 개념을 이해하지 못합니다. 내 시스템이 고릴라 이미지에 대해 …


1
정규성을 위해 큰 데이터 세트 테스트-어떻게 그리고 신뢰할 수 있습니까?
두 그룹으로 그룹화 된 1에서 1690 사이의 46840 이중 값을 포함하는 데이터 세트의 일부를 검사하고 있습니다. 이 그룹들 간의 차이점을 분석하기 위해 올바른 테스트를 선택하기 위해 값의 분포를 살펴 보았습니다. 정규성 테스트에 대한 안내에 따라 qqplot, histogram & boxplot을 수행했습니다. 이것은 정규 분포가 아닌 것 같습니다. 가이드는 순전히 그래픽 검사로는 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.