고급 분석기법 · 시계열·베이지안·비모수
시계열의 정상성과 ARIMA, 베이지안 추론, 비모수 검정, 다차원척도법, 생존분석을 다룹니다.
시계열 분석의 목적
시간 순서로 관측된 데이터에서 패턴을 찾아 미래를 예측하고, 계절성·추세를 제거해 본질적인 변동을 보는 것입니다. 관측 시점의 간격이 일정해야 하며, 결측 시점은 보간해서 채웁니다.
시계열의 4가지 구성성분
| 성분 | 의미 | 예 |
|---|---|---|
| 추세(Trend) | 장기간에 걸친 증가·감소 방향 | 인구의 지속적 증가 |
| 계절(Seasonal) | 주기가 1년 이내로 고정된 반복 | 월별 아이스크림 판매 |
| 순환(Cyclical) | 주기가 1년 이상이고 길이가 불규칙 | 경기 순환 |
| 불규칙(Irregular) | 위 셋으로 설명되지 않는 잡음 | 파업, 자연재해 |
계절성과 순환성을 가르는 기준은 주기의 길이와 규칙성입니다. "주기가 일정하지 않고 1년보다 길다"면 순환성입니다.
분해 방식은 가법 모형(Y = T + S + C + I)과 승법 모형(Y = T × S × C × I)이 있고, 변동 폭이 수준에 비례해 커지면 승법 모형이 맞습니다.
정상성(Stationarity)
시계열 분석 모형을 적용하기 위한 전제조건입니다. 세 조건을 모두 만족해야 정상 시계열입니다.
- 평균이 일정 — 시점과 무관하게 일정
- 분산이 일정 — 시점과 무관하게 일정
- 공분산(자기공분산)이 시차에만 의존 — 특정 시점에 의존하지 않음
| 위반 유형 | 처리 |
|---|---|
| 평균이 일정하지 않음 (추세 존재) | 차분(differencing) |
| 분산이 일정하지 않음 | 변환 (로그변환, Box-Cox) |
| 계절성 존재 | 계절차분 |
단골 함정: "분산이 일정하지 않으면 차분한다"는 오답입니다. 평균 → 차분, 분산 → 변환입니다. 1차 차분으로 부족하면 2차 차분까지 하지만, 보통 1~2차에서 끝납니다.
정상성 검정으로 ADF 검정(단위근 검정, 귀무가설=비정상)과 KPSS 검정(귀무가설=정상)을 씁니다.
평활법
| 방법 | 원리 | 특징 |
|---|---|---|
| 이동평균법 | 최근 n개 관측값의 단순 평균 | n이 커지면 더 부드러워지고 둔감해짐. 추세·계절이 없을 때 적합 |
| 단순지수평활법 | 최근값에 더 큰 가중치, 과거로 갈수록 지수적 감소 | 평활상수 α (0<α<1) |
| 홀트(Holt) | 지수평활 + 추세 | 추세 있는 시계열 |
| 홀트-윈터스 | 지수평활 + 추세 + 계절 | 계절성까지 있는 시계열 |
지수평활 예측식: 다음 예측값 = α × (현재 관측값) + (1 − α) × (현재 예측값)
α가 클수록 최근 값을 크게 반영해 변화에 민감하고, α가 작을수록 과거를 오래 기억해 평활 효과가 큽니다.
계산 예: α = 0.3, 현재 예측 100, 실제 관측 120이면 다음 예측 = 0.3 × 120 + 0.7 × 100 = 36 + 70 = 106.
AR · MA · ARMA · ARIMA
| 모형 | 설명 | 핵심 아이디어 |
|---|---|---|
| AR(p) 자기회귀 | 현재값을 과거 관측값들의 선형결합으로 설명 | 자기 자신의 과거 |
| MA(q) 이동평균 | 현재값을 과거 백색잡음(오차)들의 선형결합으로 설명 | 과거의 오차 |
| ARMA(p,q) | AR + MA | 정상 시계열에 적용 |
| ARIMA(p,d,q) | 비정상 시계열을 d번 차분해 ARMA로 | d = 차분 횟수 |
ARIMA(p, d, q)에서 d = 0이면 ARMA(p,q), p = 0이면 IMA(d,q), q = 0이면 ARI(p,d) 입니다. 계절성까지 포함하면 SARIMA로 확장합니다.
ACF와 PACF — 차수 결정
| 도구 | 정의 | 판독 |
|---|---|---|
| ACF 자기상관함수 | 시차 k만큼 떨어진 값들의 상관계수 | MA(q): 시차 q 이후 절단(0으로 급감) |
| PACF 부분자기상관함수 | 중간 시점의 영향을 제거한 상관 | AR(p): 시차 p 이후 절단 |
| 모형 | ACF | PACF |
|---|---|---|
| AR(p) | 지수적으로 감소 | p 이후 절단 |
| MA(q) | q 이후 절단 | 지수적으로 감소 |
| ARMA | 감소 | 감소 |
가장 자주 틀리는 지점: AR은 PACF가 끊기고, MA는 ACF가 끊긴다. 이름과 반대로 짝지어져 있어서 헷갈립니다. 또 ACF가 천천히 감소하며 오래 0에 가지 않으면 비정상 신호라 차분이 필요합니다.
베이지안 기법
사전확률과 관측 데이터를 결합해 사후확률을 갱신하는 방식입니다.
P(A|B) = P(B|A) × P(A) / P(B)
- 사전확률(prior): 데이터를 보기 전의 믿음
- 가능도(likelihood): 그 가정 아래 데이터가 관측될 확률
- 사후확률(posterior): 데이터를 본 뒤 갱신된 확률
계산 예: 질병 유병률 1%, 검사 민감도 99%, 위양성률 5%. 양성일 때 실제 환자일 확률 = (0.99 × 0.01) / (0.99 × 0.01 + 0.05 × 0.99) = 0.0099 / 0.0594 ≈ 16.7%. 정확도 높은 검사여도 유병률이 낮으면 사후확률이 낮습니다 — 기저율(base rate)의 함정.
| 빈도주의 | 베이지안 |
|---|---|
| 모수는 고정된 상수 | 모수도 확률변수 |
| 신뢰구간 | 신용구간(credible interval) |
| 사전정보 사용 안 함 | 사전분포로 사전정보 반영 |
나이브 베이즈 분류, 베이지안 네트워크, 베이지안 최적화가 여기서 파생됩니다.
비모수 검정
모집단 분포에 대한 가정(정규성 등)을 하지 않는 검정입니다. 표본 수가 적거나, 순위·범주 자료거나, 정규성을 만족하지 못할 때 씁니다. 관측값 대신 순위(rank)나 부호를 사용합니다.
| 비모수 검정 | 대응 모수 검정 | 용도 |
|---|---|---|
| 부호검정(Sign test) | 단일표본 t검정 | 중앙값 검정, 부호만 사용 |
| 윌콕슨 부호순위검정 | 대응표본 t검정 | 대응 2표본, 차이의 부호 + 크기 순위 |
| 윌콕슨 순위합검정 / 만-휘트니 U검정 | 독립표본 t검정 | 독립 2표본 비교 |
| 크루스칼-왈리스 검정 | 일원배치 분산분석 | 3개 이상 집단 비교 |
| 프리드만 검정 | 반복측정 분산분석 | 3개 이상, 대응 관계 |
| 런 검정(Run test) | — | 관측값의 무작위성(randomness) 검정 |
| 스피어만 순위상관계수 | 피어슨 상관계수 | 순위 기반 상관, 단조관계 |
| 콜모고로프-스미르노프 | — | 분포 적합도 |
함정 정리: 만-휘트니는 독립 2표본, 윌콕슨 부호순위는 대응 2표본, 크루스칼-왈리스는 3집단 이상. "런 검정으로 두 집단 평균을 비교한다" 같은 선택지는 오답이며, 런 검정은 오직 무작위성을 봅니다.
스피어만 상관계수는 −1 ≤ ρ ≤ 1이며, 순위만 쓰기 때문에 이상치에 강건하고 비선형 단조관계도 잡아냅니다. 켄달의 타우(τ)도 같은 계열입니다.
다차원척도법(MDS)
개체 간 거리(유사성/비유사성) 정보를 이용해, 개체들을 저차원(보통 2차원) 공간에 점으로 배치하는 기법입니다. 목적은 차원 축소와 시각적 군집 파악입니다.
- 계량적 MDS: 거리가 구간·비율 척도일 때 (전통적 MDS)
- 비계량적 MDS: 순서 척도만 있을 때, 순위 관계만 보존
적합도는 스트레스(Stress) 값으로 평가하며, 0에 가까울수록 좋습니다(0.05 이하 우수, 0.2 이상 부적합).
주성분분석(PCA)은 변수의 분산을 기준으로 축을 찾고, MDS는 개체 간 거리를 보존합니다. 이 차이가 자주 출제됩니다.
생존분석 개요
특정 사건(사망, 고장, 이탈)이 발생하기까지의 시간을 분석합니다. 핵심은 관측이 끝날 때까지 사건이 발생하지 않은 중도절단(censoring) 자료를 버리지 않고 활용하는 것입니다.
| 개념 | 의미 |
|---|---|
| 생존함수 S(t) | 시점 t까지 사건이 발생하지 않을 확률 |
| 위험함수 h(t) | t까지 생존했다는 조건 아래 t 시점에 사건이 발생할 순간 위험률 |
| 카플란-마이어 추정 | 생존함수를 계단식으로 비모수 추정 |
| 로그순위검정(log-rank) | 두 집단의 생존곡선 차이 검정 |
| 콕스 비례위험모형 | 공변량(설명변수)이 위험률에 미치는 영향을 준모수적으로 추정 |
생존분석은 회귀분석으로 대체할 수 없습니다. 중도절단 자료를 그냥 결측 처리하거나 사건 발생으로 처리하면 편향이 생기기 때문입니다.