통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
L-BFGS는 어떻게 작동합니까?
이 논문의 목적은 정규화 된 로그 우도를 최대화하여 일부 매개 변수를 최적화하는 것이 었습니다. 그런 다음 부분 파생 상품을 계산합니다. 그리고 저자들은 많은 변수의 부드러운 함수를 최적화하기 위해 표준 유사-뉴턴 절차 인 L-BFGS를 사용하여 방정식을 최적화한다고 언급했습니다 (더 자세한 것은 아님). 어떻게 작동합니까?

4
무료 공익 데이터 호스팅? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 3 년 전 . http://data.barrycarter.info/ 에서 많은 관측소에 대한 시간별 및 일일 온도 보고서가 있습니다. 사람들이 다운로드하도록 권장하지만 6.6G에서는 많은 대역폭을 사용합니다. "공익"데이터를 무료로 호스팅하는 서비스가 있습니까? …
14 dataset 

1
여기에서 왜 감마 분포를 선택합니까?
내 과정의 연습 중 하나에서 Kaggle 의료 데이터 세트를 사용하고 있습니다. 운동은 말한다 : 개별 요금의 분포를 모형화하고 해당 분포에 대한 불확실성을 캡처하여 볼 수있는 값의 범위를 더 잘 포착 할 수 있기를 원합니다. 데이터로드 및 초기보기 수행 : 위와 같이 여기에 기하 급수적으로 분포하는 분포가 있다고 의심 할 수 …

3
두 주파수 분포 사이의 통계적 "거리"를 측정하는 방법은 무엇입니까?
연중 웹 사이트 사용 시간을 조사하는 데이터 분석 프로젝트를 수행하고 있습니다. 내가하고 싶은 것은 사용 패턴이 얼마나 "일관성"인지, 즉 일주일에 한 번 1 시간 동안 사용하는 패턴과 얼마나 가까운 지 비교하고, 한 번에 10 분 동안 사용하는 패턴과 얼마나 유사한 지 비교하는 것입니다. 주당 시간. 계산할 수있는 몇 가지 사항을 …

2
Wolfram Mathworld는 확률 밀도 함수를 사용하여 불연속 확률 분포를 설명하는 실수를합니까?
일반적으로 불연속 변수에 대한 확률 분포는 확률 질량 함수 (PMF)를 사용하여 설명됩니다. 연속 랜덤 변수로 작업 할 때 확률 질량 함수가 아닌 확률 밀도 함수 (PDF)를 사용하여 확률 분포를 설명합니다. - 깊은 학습 Goodfellow, Bengio 및 Courville로 그러나 Wolfram Mathworld 는 이산 변수에 대한 확률 분포를 설명하기 위해 PDF를 사용하고 …

1
주어진 데이터 세트에서 가장 큰 값과 가장 작은 값의 평균 이름은 무엇입니까?
주어진 데이터 세트에서 상위 및 하위 극단에서 계산 된 통계적 평균을 무엇이라고합니까? 예를 들어, 세트가있는 경우 : { -2, 0 , 8, 9, 1, 50, -2, 6} 이 세트의 상단 극단은 50이고 하단 극단은 -2입니다. 따라서 극단의 평균은(-2 + 50 / 2) = 48/2 = 24 이런 종류의 통계적 의미에 …

2
지속적인 데이터에서 범주 형으로가는 것이 항상 잘못입니까?
데이터를 설정하는 방법에 대해 읽을 때 자주 접하는 한 가지 점은 일부 연속 데이터를 범주 형 데이터로 변환하는 것은 좋은 생각이 아니라는 것입니다. 임계 값이 잘못 결정되면 잘못 결론을 내릴 수 있기 때문입니다. 그러나 현재 일부 데이터 (전립선 암 환자의 PSA 값)가 있습니다. 여기서 일반적인 합의는 4 세 미만이면 아마도 …

5
여러 시리즈를 동시에 처리하는 방법?
25 개 기간 동안 여러 제품 (1200 개 제품)의 수요를 포함한 데이터 세트가 있으며 다음 기간 동안 각 제품의 수요를 예측해야합니다. 처음에는 ARIMA를 사용하고 각 제품에 대한 모델을 학습하고 싶었지만 제품 수와 (p, d, q) 매개 변수 조정으로 인해 시간이 많이 걸리고 실용적이지 않습니다. 이전 요구가 독립 변수 인 경우 …

3
신뢰 구간은 언제 "이해"되지만 해당 신뢰 구간이 그렇지 않습니까?
적용 범위가 95 % 인 신뢰 구간이 사후 밀도의 95 %를 포함하는 신뢰할 수있는 구간과 매우 유사한 경우가 종종 있습니다. 이는 후자의 경우 사전이 균일하거나 거의 균일 할 때 발생합니다. 따라서 신뢰 구간을 사용하여 신뢰할 수있는 구간을 추정 할 수 있으며 그 반대도 마찬가지입니다. 중요한 것은 신뢰할 수있는 구간으로 신뢰 …

2
표본 분포와 무관 한 통계의 예?
이것은 wikipedia의 통계 에 대한 정의입니다. 보다 공식적으로 통계 이론은 통계 자체가 함수가 표본의 분포와 무관 한 표본의 함수로 정의합니다. 즉, 데이터를 실현하기 전에 기능을 설명 할 수 있습니다. 통계라는 용어는 함수와 주어진 샘플의 함수 값에 모두 사용됩니다. 나는이 정의의 대부분을 이해한다고 생각하지만, 그 부분 은 함수가 샘플의 분포와 무관 …

2
분포 모멘트를 사용하여 분포를 샘플링 할 수 있습니까?
통계 / 기계 학습 방법에서 분포는 종종 가우시안에 의해 근사되며 가우시안이 샘플링에 사용됩니다. 분포의 처음 두 모멘트를 계산하는 것으로 시작하여 μμ\mu 및 σ2σ2\sigma^2 를 추정하는 데 사용합니다 . 그런 다음 가우시안에서 샘플링 할 수 있습니다. 내가 계산하는 순간이 많을수록 표본 추출하려는 분포를 근사화 할 수 있어야합니다. 3 모멘트를 계산하면 어떻게됩니까? …

5
선형 회귀가 알려진 이론적 선과 통계적으로 유의 한 차이가 있는지 어떻게 계산합니까?
대략 선형 선에 맞는 데이터가 있습니다. 이 값의 선형 회귀를 수행하면 선형 방정식이 나타납니다. y=0.997x−0.0136y=0.997x−0.0136y = 0.997x-0.0136 이상적인 세계에서 방정식 은 이어야 합니다 .y=xy=xy = x 분명히, 내 선형 값은 그 이상에 가깝지만 정확하게는 아닙니다. 제 질문은 이 결과가 통계적으로 유의한지 어떻게 확인할 수 있습니까? 0.997의 값이 1과 크게 다른 …

2
Cauchy 분포는 어떻게 든 "예측할 수없는"분포입니까?
Cauchy 분포는 어떻게 든 "예측할 수없는"분포입니까? 나는 노력했다 cs <- function(n) { return(rcauchy(n,0,1)) } 다수의 n 값에 대해 R에서 R은 때때로 예측할 수없는 값을 생성한다는 것을 알았습니다. 예를 들어 비교 as <- function(n) { return(rnorm(n,0,1)) } 항상 "소형"의 구름을 제공하는 것 같습니다. 이 그림으로 정규 분포처럼 보일까요? 그러나 값의 하위 …

2
심슨 가족 (TV 시리즈)이 미래를“예측”하는 데 성공한 이유는 무엇입니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 2 년 전 . 그것은 심벌즈 (TV 시리즈)가 미래를 반복적으로 예측했을 정도로 노란색이 아닌 노란색으로 널리 언급되었습니다. 이에 대한 포괄적 인 온라인 기사는 여기 와 여기에 있습니다 …

3
만약
질문 경우 X1,⋯,Xn∼N(μ,1)X1,⋯,Xn∼N(μ,1)X_1,\cdots,X_n \sim \mathcal{N}(\mu, 1) IID 후 계산되어 E(X1∣T)E(X1∣T)\mathbb{E}\left( X_1 \mid T \right) 여기서는 T=∑iXiT=∑iXiT = \sum_i X_i . 시도 : 아래가 올바른지 확인하십시오. ∑iE(Xi∣T)=E(∑iXi∣T)=T.∑iE(Xi∣T)=E(∑iXi∣T)=T.\begin{align} \sum_i \mathbb{E}\left( X_i \mid T \right) = \mathbb{E}\left( \sum_i X_i \mid T \right) = T . \end{align} 와 같은 조건부 기대 값의 합을합시다 . …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.