통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

1
동등성의 귀무 가설
이 정규 분포 에서 추출한 단순한 랜덤 표본 이라고 가정 합니다.X1,X2,...,XnX1,X2,...,XnX_1, X_2, \, ... \, , X_n(μ,σ2)(μ,σ2)(\mu,\sigma^2) 다음과 같은 가설 검정에 관심이 있습니다. 소정의 상수 .H0:|μ|≤cH1:|μ|>c,H0:|μ|≤cH1:|μ|>c, H_0: | \mu| \le c \\ H_1: |\mu| > c, c>0c>0c > 0 나는이 일방적 수행하는 생각 일반적인 생물학적 동등성 시험 상황, 널에 유사한 …

1
Neg Binomial과 Jeffreys 'Prior
음의 이항 분포에 대해 Jeffreys를 먼저 얻으려고합니다. 내가 어디로 잘못 가고 있는지 알 수 없으므로 누군가가 그 점을 지적하면 도움이 될 것입니다. 좋아, 그래서 상황이있다 : I는 이항 및 음 이항를 사용하여 얻어진 이전의 분포를 비교이다 (두 경우 모두에서)가 어디에 시험과 m의 성공은. 이항 경우에 대한 정답을 얻지 만 음수 …

2
시계열 데이터에 대한 공간 자기 상관
나는 다각형 세트 (~ 200 개의 불규칙한 모양의 연속 다각형)에 대한 연간 종의 풍부도에 대한 20 년 데이터 세트를 가지고 있습니다. 회귀 분석을 사용하여 각 다각형의 추세 (연간 개수 변경)와 관리 경계를 기반으로 한 다각형 데이터 집계를 추론했습니다. 데이터에 공간 자기 상관이 있다고 확신하며, 이는 집계 된 데이터의 회귀 분석에 …

2
이 모델 접근 방식에 과적 합이 있습니까?
나는 최근에 내가 따르는 과정 (MS 논문의 구성 요소)이 과적 합으로 보일 수 있다고 들었다. 나는 이것을 더 잘 이해하고 다른 사람들이 동의하는지 확인하려고합니다. 이 부분의 목적 은 데이터 세트에서 그라디언트 부스트 회귀 트리의 성능을 랜덤 포레스트와 비교하십시오. 선택한 최종 모델 (GBM 또는 RF)의 성능을 확인하십시오. R 의 gbm및 randomForest패키지가 …

2
메타 회귀 분석에서 효과 크기를 독립 변수로 포함 할 수 있습니까?
내 질문은 효과 크기 엑스XX 를 종속 변수로 사용하고 다른 효과 크기 와이YY 를 메타 회귀 분석에서 독립 변수로 사용할 수 있는지 여부입니다 . 예를 들어, 나는 음주 문제에서 운동의 영향에 대한 메타 분석을 수행했으며 상당한 결과와 높은 이질성을 발견했습니다. 메타 회귀 분석을 수행하고 불안에 대한 중재의 영향 크기를 독립 …

4
베이지안 정보가없는 사전 대 잦은 귀무 가설 : 관계는 무엇입니까?
나는 블로그 게시물에이 이미지를 가로 질러왔다 여기 . 나는 그 진술을 읽는 것이이 남자와 똑같은 표정을 이끌어 내지 못했다는 것에 실망했다. 그렇다면 귀무 가설이 빈번한 사람들이 정보가없는 사전을 어떻게 표현하는지에 대한 진술의 의미는 무엇입니까? 정말 사실입니까? 편집 : 나는 누군가가 느슨한 의미 에서조차 진술을 진실하게하는 자선 해석을 제공 할 수 …

8
고차원 데이터 시각화
고차원 공간의 벡터 인 두 클래스의 샘플이 있으며 2D 또는 3D로 플롯하고 싶습니다. 나는 차원 축소 기술에 대해 알고 있지만 matlab, python 또는 미리 작성된 .exe에서 정말 간단하고 사용하기 쉬운 도구가 필요합니다. 또한 2D 표현이 "의미"가 될지 궁금합니다. (예를 들어 두 클래스가 교차하거나 분리 가능한 방법).

2
포아송 회귀에 대한 좋은 시각화는 무엇입니까?
코드 결함을 근접성과 같은 코드 복잡성 메트릭과 연관시키고 싶습니다. 일반적인 모델 중 하나는 이것을 Poisson 프로세스로 보는 것인데, 여기서 지속 시간은 코딩에 소요되는 시간과 밀도는 코드 복잡성의 함수입니다. 회귀를 수행하고 유의성 값 등을 얻을 수 있습니다. 그러나 결과를 시각화하기가 어렵습니다 (수학적으로 기울어지지 않은 동료에게는 더 어렵습니다). 선형 추세 인 경우 …

2
두 명목 변수 사이의 상관 관계 측정 방법을 찾으려면 어떻게합니까?
사람들이 특정 스마일을 사용하여 자신의 출신 국을 대표하고 입국 한 것을 선택하는 설문 조사가 이루어졌습니다. 텍스트 응답을 숫자로 코딩했습니다. 사람들이 어디에서 왔으며 그들이 선택한 표현 사이의 상관 관계 수준을 확인하려면 어떤 형태의 분석을 사용해야합니까 (SPSS에서 선호)?

8
사회 과학에서 학부 입문 통계 과정을 가르치는 데 적합한 통계 소프트웨어는 무엇입니까?
사회 과학 연구 프로그램에 대한 입문 통계 과정에서 사용할 수있는 통계 소프트웨어 패키지를 찾고 있습니다. 학생들은 통계에 대한 사전 지식이없고 프로그래밍 언어에 대한 경험이 없습니다. 목표는 기본 통계 개념 (평균, 분산, 제곱합, p- 값 등)과 선형 회귀 분석을 소개하고 예제 데이터 세트를 사용하여 자체적으로 기본 분석을 수행 할 수 있도록하는 …

1
직관적 인 이해 공분산, 상호 공분산, 자동 / 교차 상관 및 전력 스펙트럼 밀도
저는 현재 ECE 학사에 대한 기본 통계에서 결승을 위해 공부하고 있습니다. 나는 수학이 대부분 아래에 있다고 생각하지만 실제로 숫자의 의미를 직관적으로 이해하지 못합니다. 나는 E [X]가 확률에 의해 가중 된 X의 모든 결과의 "가중 평균"이라는 것을 알고 있습니다. Var [X]는 E [X]의 예상 분산을 제곱하므로 분포의 "흐림"에 대해 알려줍니다. 다른 …

1
가우스 프로세스 및 Wishart 분포에 대한 공분산 행렬
이 글을 통해 GWP ( Generalized Wishart Processes) 에 대해 읽고 있습니다. 이 논문은 제곱 지수 공분산 함수, 즉 사용하여 다른 랜덤 변수 ( 가우시안 프로세스에 따른 ) 간의 공분산을 계산합니다. . 그런 다음이 공분산 행렬은 GWP를 따릅니다.케이( x , x') = exp( − | ( x − x') |22 …

5
공선 변수로 수행 할 작업
면책 조항 : 이것은 숙제 프로젝트입니다. 나는 여러 변수에 따라 다이아몬드 가격에 가장 적합한 모델을 만들려고 노력하고 있으며 지금까지 꽤 좋은 모델을 가지고있는 것 같습니다. 그러나 분명히 공선 인 두 가지 변수가 있습니다. >with(diamonds, cor(data.frame(Table, Depth, Carat.Weight))) Table Depth Carat.Weight Table 1.00000000 -0.41035485 0.05237998 Depth -0.41035485 1.00000000 0.01779489 Carat.Weight 0.05237998 …

5
포아송이 아니라면 이것은 어떤 분포입니까?
7 일 동안 개인이 수행 한 작업 수를 포함하는 데이터 세트가 있습니다. 구체적인 조치는이 질문과 관련이 없어야합니다. 다음은 데이터 세트에 대한 설명 통계입니다. 범위평균변화관측치 수0 - 77218.22791696Range0−772Mean18.2Variance2791Number of observations696 \begin{array}{|c|c|} \hline \text{Range} & 0 - 772 \\ \hline \text{Mean} & 18.2 \\ \hline \text{Variance} & 2791 \\ \hline \text{Number of …

1
웰치 검정의 자유도는 항상 합동 검정의 DF보다 작습니까?
기초 통계에 대한 과정을 가르치고 있으며 분산이 다른 두 개의 독립 표본에 대해 t- 검정을 수행하고 있습니다 (웰 테스트). 내가 본 예제에서 Welch 테스트에 사용 된 조정 된 자유도는 항상 이하 합니다. n1+n2−2n1+n2−2n_1+n_2-2 항상 그런가요? Welch 검정은 항상 풀링 된 (동일한 분산) t- 검정의 자유도를 줄입니까 (또는 변경하지 않은 채로 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.