통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
종단 데이터 중에서 그룹화 (궤도)를 찾는 방법은 무엇입니까?
문맥 질문을 다소 확장하기 전에 장면을 설정하고 싶습니다. 나는 약 3 개월마다 피험자에 대해 측정 한 세로 데이터를 가지고 있으며, 1 차 결과는 5에서 14 사이의 숫자 (연속 1dp에서와 같이)는 7에서 10 사이의 벌크 (모든 데이터 포인트 중)입니다. 스파게티 플롯 (x 축의 나이와 각 사람의 선이있는)은 1500 개가 넘는 과목이있을 …

1
연속 분포에서 데이터의 최적 이산화 결정
당신이 데이터 세트를 가정 알려지지 않은 에서 지원되는 Y1,...,YnY1,...,YnY_{1}, ..., Y_{n}밀도 를 갖는 연속 분포로부터의 Y n 이지만, 은 꽤 커서 커널 밀도 (예를 들어) 는 다음과 같습니다. 꽤 정확한. 특정 응용 프로그램의 경우 관측 된 데이터를 한정된 수의 범주로 변환하여 암시 된 질량 함수 를 사용하여 새로운 데이터 세트 …

1
파이썬에서 scree plot을 그리는 방법은 무엇입니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 작년에 문을 닫았 습니다 . 행렬에서 특이 벡터 분해를 사용하고 U, S 및 Vt 행렬을 얻고 있습니다. 이 시점에서 유지할 차원 수에 대한 임계 값을 선택하려고합니다. 나는 scree …

4
k- 평균에서 최적의 k가없는 경우가 있습니까?
이것은 적어도 몇 시간 동안 내 마음 속에있었습니다. k- 평균 알고리즘 ( 코사인 유사성 메트릭 사용 ) 의 출력에 대한 최적의 k를 찾으려고 노력 했기 때문에 클러스터 수의 함수로 왜곡을 플로팅했습니다. 내 데이터 세트는 600 차원 공간에 800 개의 문서를 모은 것입니다. 내가 이해 한 바에 따르면,이 곡선에서 무릎 점 …


1
혼합 효과 모델에서 잔차를 부트 스트랩하면 왜 보수적이지 않은 신뢰 구간이 생성됩니까?
나는 일반적으로 두 개 이상의 조건에서 여러 개인이 각각 여러 번 측정되는 데이터를 처리합니다. 최근에는 혼합 효과 모델링을 사용하여 조건 간의 차이에 대한 증거를 평가 individual하고 무작위 효과로 모델링 했습니다. 이러한 모델링의 예측에 관한 불확실성을 시각화하기 위해 부트 스트랩을 사용하고 있습니다. 부트 스트랩을 사용할 때마다 개별적으로 부트 스트랩을 반복 할 …

2
분류 트리 (rpart에서)를 규칙 세트로 구성합니까?
rpart (R)를 사용하여 복잡한 분류 트리를 구성한 후에 각 클래스에 대해 생성 된 결정 규칙을 구성하는 방법이 있습니까? 하나의 거대한 트리를 얻는 대신 각 클래스에 대한 규칙 세트를 얻습니까? (그렇다면 어떻게?) 다음은 예제를 보여주는 간단한 코드 예제입니다. fit <- rpart(Kyphosis ~ Age + Number + Start, data=kyphosis) 감사.
11 r  classification  cart  rpart 

5
공칭 / 원형 변수에 대한 SOM 클러스터링
공칭 입력 클러스터링에 익숙한 사람이 있는지 궁금합니다. 나는 SOM을 솔루션으로보고 있지만 분명히 숫자 기능에서만 작동합니다. 범주 형 기능에 대한 확장이 있습니까? 특히 가능한 기능으로 'Days of the Week'에 대해 궁금했습니다. 물론 수치 적 특징으로 변환하는 것이 가능합니다 (즉, 1-7에 해당하는 Mon-Sun) 그러나 Sun과 Mon (1 & 7) 사이의 유클리드 거리는 …

1
대장균 발생 분석에 대해 통계학자는 어떤 질문을합니까?
당신은 독일에서 최근의 enterohaemorrhagic E. coli ( EHEC ) 발생에 대해 들었을 것 입니다 . 통계학자는 EHEC 분석에 대해 어떤 질문을합니까? 기자 / 공무원 ↔ 비전문가 사이의 Q + A를 생각하고 있습니다. Diplom / Master 's 학위를 가진 교사와 엔지니어는 있지만 통계는 상당히 불분명합니다. (그림, 다양한 EHEC 변형률 및 다양한 …

2
카이-제곱 변이의 무한 수집에 대한 주문 통계 (예 : 최소)?
이번이 처음이므로 형식, 태그 등 어떤 식 으로든 내 질문을 명확하게 설명 할 수 있는지 알려주십시오. (그리고 나중에 편집 할 수 있기를 바랍니다!) 참조를 찾으려고 유도를 사용하여 자신을 해결하려고했지만 둘 다 실패했습니다. 자유도가 다른 독립 변수 임의의 변수 의 순서 통계로 축소하는 분포를 단순화하려고합니다 . 구체적으로, 독립 중 번째로 작은 …

3
ggplot2를 사용하여 두 데이터 세트를 QQ 플롯과 비교하는 방법은 무엇입니까?
통계와 R 초보자 모두 1 : 1의 종횡비로 qqplots를 생성하는 데 어려움을 겪고 있습니다. ggplot2는 기본 R 플로팅 패키지보다 플로팅에 대해 훨씬 많은 제어 기능을 제공하는 것으로 보이지만 ggplot2에서 qqplot을 수행하여 두 데이터 세트를 비교하는 방법을 알 수 없습니다. 그래서 내 질문에, ggplot2는 다음과 같은 것이 무엇입니까? qqplot(datset1,dataset2)

2
2D로 다차원 데이터 (LSI) 시각화
나는 문서 간의 유사성을 찾기 위해 잠재 의미 색인을 사용하고 있습니다 ( 감사, JMS를! ) 차원 축소 후에 문서를 클러스터로 그룹화하기 위해 k- 평균 군집화를 시도했지만 매우 효과적입니다. 그러나 조금 더 나아가서 두 노드 사이의 거리가 유사성에 반비례하는 노드 세트로 문서를 시각화하고 싶습니다 (매우 유사한 노드는 서로 가깝습니다). 내 데이터가 …

3
희소 예측 변수 및 반응을 사용하는 CART와 유사한 방법에 사용할 수있는 라이브러리가 있습니까?
R의 gbm 패키지를 사용하여 일부 큰 데이터 세트로 작업하고 있습니다. 예측 변수 행렬과 응답 벡터가 매우 희박합니다 (즉, 대부분의 항목이 0 임). 나는 여기 에서했던 것처럼이 sparseness를 이용하는 알고리즘을 사용하여 의사 결정 트리를 구축하기를 바랐다 . 이 백서에서와 같이 대부분의 항목에는 가능한 많은 기능 중 일부만 있으므로 데이터가 명시 적으로 …

7
국가 유형을 식별하는 데이터 축소 기술
나는 입문 경제 지리 과정을 가르칩니다. 학생들이 현대 세계 경제에서 발견되는 국가의 종류에 대한 이해와 데이터 축소 기술에 대한 이해를 높이기 위해 다른 종류의 국가 (예 : 고소득 고소득층)의 유형학을 생성하는 과제를 구성하고 싶습니다. 부가 가치는 장수명 기대, 고소득 천연 자원 수출 중반 고수 명 기대, 독일은 첫 번째 유형의 …

1
중앙값 및 그래픽 표현으로보고하는 데 오류가 있습니까?
파라 메트릭 분산 분석 및 t- 테스트에서 비 파라 메트릭 Kruskal-Wallis 테스트 및 Mann-Whitneys에 이르기까지 랭크 변환 된 2-way ANOVA와 바이너리가 포함 된 GzLM, 포아송 및 비례 데이터. 이제 결과를 모두 작성하면서 모든 내용을보고해야합니다. 비율 데이터에 대한 비대칭 신뢰 구간을보고하는 방법을 이미 여기에 요청 했습니다 . 표준 편차, 표준 오류 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.