통계 및 빅 데이터

통계, 기계 학습, 데이터 분석, 데이터 마이닝 및 데이터 시각화에 관심있는 사람들을위한 Q & A

2
R에서 이름으로 열 인덱스 찾기 [닫기]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 육년 전 . 데이터 프레임에서 열의 색인을 이름별로 가져 오려고합니다. 예를 들면 다음과 같습니다. x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) "bar"에 대한 열 인덱스를 알고 싶습니다. 나는 다음을 생각해 냈지만 …
11 r 

1
불확실성 집계 방법을 시각화하는 데 유용한 그래픽 방법은 무엇입니까?
불확실성이 축적되는 일련의 시스템이 있습니다. 이것들은 항상 순전히 부가적인 것은 아니며 때로는 그렇지 않은 경우도 있습니다. 팬 차트, 신뢰 구간이있는 막대 차트 및 단일 항목 통신을위한 상자 그림을 사용하는 데 성공했습니다. 그러나 어떻게 불확실성이 축적되고 결합되는지 보여줄 수있을뿐만 아니라 불확실성이있는 데이터 포인트를 보여줄 수 있습니까?

1
수식을 아래로 끌 때 Excel이 범위를 변경하지 못하게하는 방법은 무엇입니까? [닫은]
닫은. 이 질문은 주제에 맞지 않습니다 . 현재 답변을받지 않습니다. 이 질문을 개선하고 싶습니까? 교차 검증에 대한 주제가 되도록 질문을 업데이트하십시오 . 휴일 칠년 전에 . Excel 스프레드 시트에서 일련의 데이터 열을 정규화하려고합니다. 열에서 가장 높은 값이 1이고 가장 낮은 값이 0이되도록 값을 가져와야하므로 수식을 생각해 냈습니다. =(A1-MIN(A1:A30))/(MAX(A1:A30)-MIN(A1:A30)) 이것은 잘 …
11 excel 

1
ARIMA (1,1,0) 시리즈의 시뮬레이션
ARIMA 모델을 원래 시계열에 맞췄으며 최상의 모델은 ARIMA (1,1,0)입니다. 이제 해당 모델에서 시리즈를 시뮬레이션하고 싶습니다. 간단한 AR (1) 모델을 작성했지만 모델 ARI (1,1,0) 내에서 차이를 조정하는 방법을 이해할 수 없었습니다. AR (1) 시리즈에 대한 다음 R 코드는 다음과 같습니다. phi= -0.7048 z=rep(0,100) e=rnorm(n=100,0,0.345) cons=2.1 z[1]=4.1 for (i in 2:100) z[i]=cons+phi*z[i-1]+e[i] …
11 r  time-series  arima 

2
두 가중 랜덤 변수의 분산
허락하다: 랜덤 변수 의 표준 편차A=σ1=5A=σ1=5A =\sigma_{1}=5 랜덤 변수 의 표준 편차B=σ2=4B=σ2=4B=\sigma_{2}=4 그런 다음 A + B의 분산은 다음과 같습니다. Var(w1A+w2B)=w21σ21+w22σ22+2w1w2p1,2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} 어디: p1,2p1,2p_{1,2} 는 두 랜덤 변수의 상관 관계입니다. w1w1w_{1} 은 랜덤 변수 A의 가중치입니다 승2w2w_{2} 는 랜덤 변수 B의 가중치입니다 승1+ 승2= 1w1+w2=1w_{1}+w_{2}=1 아래 그림은 상관 관계 …

4
k- 평균의 구현을 어떻게 테스트합니까?
면책 조항 : 나는이 질문을 Stackoverflow에 게시했지만 이것이이 플랫폼에 더 적합하다고 생각했습니다. 다차원 데이터 세트에 대한 고유 한 k- 평균 구현을 어떻게 테스트합니까? 데이터에 이미 존재하는 구현 (예 : Matlab)을 실행하고 결과를 내 알고리즘과 비교할 생각이었습니다. 그러나 이것은 두 알고리즘이 거의 동일하게 작동해야하며 두 결과 사이의 매핑은 아마도 케이크 조각이 …

1
샘플 Quantile 대신 Cornish-Fisher 확장을 사용해야하는 이유는 무엇입니까?
콘월어 - 피셔 확장 순간을 기반으로 분포의 분위수를 추정 할 수있는 방법을 제공합니다. (이 점에서, 그것은 순간에 기초한 누적 분포의 추정치를 제공하는 Edgeworth Expansion 의 보완으로 간주됩니다 .) 어떤 상황에서 경험적 작업을 위해 Cornish-Fisher 확장을 선호하는지 알고 싶습니다. 샘플 Quantile 또는 그 반대로. 몇 가지 추측 : 계산적으로, 샘플 모멘트는 …

3
거대한 샘플로 t- 검정을 수행하는 방법은 무엇입니까?
두 개 모집단이 있는데, 하나는 N = 38,704 (관찰 횟수)이고 다른 하나는 N = 1,313,662입니다. 이 데이터 세트에는 ~ 25 개의 변수가 있으며 모두 연속적입니다. 각 데이터 세트에서 각각의 평균을 취하고 공식을 사용하여 검정 통계량을 계산했습니다. t = 평균 차이 / 표준 오차 문제는 자유의 정도입니다. df = N1 + …
11 t-test 

2
복잡한 계절성에 대한 계절성 지수 계산
지수 평활을 사용하여 소매 항목 (주별)을 예측하고 싶습니다. 나는 sesonality 인덱스를 계산하고 저장하고 적용하는 방법에 지금 붙어 있습니다. 문제는 내가 찾은 모든 예제가 일종의 간단한 계절성을 다루는 것입니다. 제 경우에는 다음과 같은 문제가 있습니다. 1. 매년 같은 주에 계절이 발생하지 않습니다 : 움직일 수 있습니다. 마디-그라, 빌트, 부활절 및 기타 …

2
소프트 임계 값 대 올가미 벌점
지금까지 고차원 데이터 세트를 사용하여 불이익을받은 다변량 분석에서 이해 한 내용을 요약하려고하지만 소프트 임계 값 대 Lasso (또는 ) 불이익에 대한 적절한 정의를 얻는 데 어려움을 겪고 있습니다.L1L1L_1 보다 정확하게는, 희소 한 PLS 회귀 분석을 사용하여 게놈 데이터 ( 단일 뉴클레오티드 다형성 , 우리는 수치 변수로 간주되는 {0,1,2} 범위의 작은 …

5
두 가지 분석 방법이 동일하다는 것을 나타내는 방법은 무엇입니까?
매트릭스에서 특정 분자의 농도를 측정 할 수있는 두 가지 분석 방법이 있습니다 (예 : 물의 소금 양을 측정하십시오) 두 가지 방법이 다르며 각각 고유 한 오류가 있습니다. 두 가지 방법이 동일하거나 그렇지 않은 방법을 보여주는 방법은 무엇입니까? 분산 그래프에서 두 방법으로 측정 한 여러 샘플의 결과를 플로팅하는 것이 좋은 첫 …

3
가 연속적이고 불연속 일 때
는 연속 랜덤 변수이고 는 이산 변수 라고 가정하십시오 . YYYXXXPr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y)Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y) \Pr(X=x|Y=y) = \frac{\Pr(X=x)\Pr(Y=y|X=x)}{\Pr(Y=y)} 아시다시피, 는 연속 랜덤 변수 이므로 입니다. 그리고 이것을 바탕으로 확률 가 정의되어 있지 결론을 내립니다 .Pr(Y=y)=0Pr(Y=y)=0\Pr(Y=y) = 0YYYPr(X=x|Y=y)Pr(X=x|Y=y)\Pr(X=x|Y=y) 그러나 Wikipedia는 여기서 실제로 다음과 같이 정의되어 있다고 주장 합니다. Pr(X=x|Y=y)=Pr(X=x)fY|X=x(y)fY(y)Pr(X=x|Y=y)=Pr(X=x)fY|X=x(y)fY(y) \Pr(X=x|Y=y) = \frac{\Pr(X=x) f_{Y|X=x}(y)}{f_Y(y)} 질문 : …

1
제한된 입방 스플라인과 페널티 스플라인은 어떻게 다릅니 까?
다양한 회귀 문제에서 스플라인 사용에 대해 많이 읽고 있습니다. 일부 책 (예 : Hodges Richly Parrameterized Linear Models )은 불이익 스플라인을 권장합니다. 다른 사람 (예 : Harrell Regression Modeling Strategies )은 제한된 입방 스플라인을 선택합니다. 실제로 이것들은 얼마나 다른가? 하나 또는 다른 것을 사용하여 종종 실질적으로 다른 결과를 얻습니까? 하나 …

1
"먼저 스파 스"라는 용어는 (FBProphet Paper)를 의미합니까?
"예측 규모 예측"(FBProphet 예측 도구, https://peerj.com/preprints/3190.pdf 참조 )을 읽으면서 나는 "먼저 스파 스"라는 용어를 발견했습니다. 저자 는 로지스틱 성장 모델의 모델 매개 변수 인 스칼라 비율 에서 속도 편차 벡터를 모델링 할 때 이러한 "스파 스 이전"을 사용했다고 설명합니다 .δδ\mathbf{\delta}kkk 그들이 라고 말하면서, 매개 변수 가 작 으면 "sparse"가 0에 …

4
왜 하이퍼 파라미터를 배우지 않습니까?
나는 매우 인기있는 논문 인 " EXLAINING AND HARNESSING ADVERSARIAL EXAMPLES "를 구현하고 있었고 논문에서 적대적인 목적 함수를 훈련시켰다. J ''(θ) = αJ (θ) + (1-α) J '(θ). α를 하이퍼 파라미터로 취급합니다. α는 0.1, 0.2, 0.3 등이 될 수 있습니다. 이 특정 논문에 관계없이 α를 매개 변수에 포함시키고 최고의 α를 …

당사 사이트를 사용함과 동시에 당사의 쿠키 정책개인정보 보호정책을 읽고 이해하였음을 인정하는 것으로 간주합니다.
Licensed under cc by-sa 3.0 with attribution required.