← 개념서태블릿/PC 버전
3과목 · 빅데이터 모델링·3

회귀분석

단순·다중 회귀와 최소제곱법, 회귀분석의 5가지 가정, 결정계수와 수정결정계수, 다중공선성과 VIF, 변수 선택, 정규화 회귀(Ridge·Lasso·Elastic Net), 로지스틱 회귀와 오즈비를 다룹니다.

회귀분석의 기본

독립변수(설명변수)종속변수(반응변수) 에 미치는 영향을 함수 관계로 추정하는 기법입니다.

구분 모형
단순 선형 회귀 Y = β₀ + β₁X + ε — 독립변수 1개
다중 선형 회귀 Y = β₀ + β₁X₁ + β₂X₂ + ... + βₖXₖ + ε — 독립변수 2개 이상
다항 회귀 독립변수의 거듭제곱 항 포함. 모수에 대해서는 여전히 선형
로지스틱 회귀 종속변수가 범주형(이항) 일 때

회귀계수는 최소제곱법(OLS, 최소자승법) 으로 추정합니다. 관측값과 예측값의 차이인 잔차의 제곱합(SSE)을 최소로 만드는 계수를 찾는 방식입니다.

"오차의 합을 최소화한다"는 오답입니다. 오차는 부호가 상쇄되므로 제곱합을 최소화합니다. 그리고 최소제곱 회귀선은 항상 (X평균, Y평균) 점을 지나며 잔차의 합은 0입니다.

회귀분석의 5가지 가정

가정 의미 확인 방법
선형성 독립변수와 종속변수가 선형 관계 산점도, 잔차 vs 예측값 그림
독립성 잔차들이 서로 독립(자기상관 없음) 더빈-왓슨 통계량(2에 가까우면 독립)
등분산성 잔차의 분산이 X와 무관하게 일정 잔차 산점도가 특정 패턴 없이 흩어짐
정규성 잔차가 정규분포를 따름 Q-Q plot, 샤피로-윌크 검정
비상관성(다중공선성 없음) 독립변수들 간 강한 상관이 없음 VIF, 상관계수 행렬

더빈-왓슨 통계량은 0~4 사이 값이며 2 근처면 자기상관 없음, 0에 가까우면 양의 자기상관, 4에 가까우면 음의 자기상관입니다. "0에 가까울수록 좋다"는 오답입니다.

모형의 설명력

총변동 SST = 회귀에 의한 변동 SSR + 설명 못한 변동 SSE

지표 해석
결정계수 R² SSR / SST = 1 - SSE/SST 총변동 중 회귀식이 설명하는 비율. 0~1
수정결정계수 1 - (1-R²)(n-1)/(n-k-1) 독립변수 수 k에 대한 벌점 부여

수치 예제. n = 20, 독립변수 k = 3, R² = 0.80 이라면 수정 R² = 1 - (1 - 0.80) × (20-1) / (20-3-1) = 1 - 0.20 × 19 / 16 = 1 - 0.2375 = 0.7625

R²는 의미 없는 변수를 넣어도 절대 감소하지 않습니다. 그래서 다중 회귀에서 모형을 비교할 때는 수정결정계수를 봅니다. 수정 R²는 쓸모없는 변수를 넣으면 줄어들 수 있고, 음수도 가능합니다.

회귀모형의 유의성은 F-검정(모형 전체), 개별 회귀계수의 유의성은 t-검정으로 판정합니다.

다중공선성

독립변수들끼리 강한 상관이 있어 계수 추정이 불안정해지는 현상입니다. 계수의 부호가 상식과 반대로 나오거나 표준오차가 폭증합니다.

진단 기준
VIF (분산팽창요인) VIFⱼ = 1 / (1 - Rⱼ²). 10 이상이면 다중공선성 의심(엄격히는 5)
공차 한계(Tolerance) 1 / VIF. 0.1 미만이면 문제
상태지수(Condition Index) 10~30 주의, 30 이상 심각

수치 예제. 어떤 독립변수를 나머지 독립변수로 회귀했을 때 Rⱼ² = 0.95 → VIF = 1 / (1 - 0.95) = 1 / 0.05 = 20 → 다중공선성 심각.

해결책: 변수 제거, 주성분분석(PCA)으로 차원 축소, 정규화 회귀(Ridge), 표본 수 확대.

"다중공선성은 R²를 낮춘다"는 오답입니다. R²는 오히려 높은데 개별 계수는 유의하지 않은 모순적 상황이 다중공선성의 전형적 징후입니다.

변수 선택 방법

방법 절차
전진 선택법 아무것도 없는 상태에서 가장 기여도 큰 변수를 하나씩 추가, 더 이상 개선 없으면 중단
후진 제거법 모든 변수를 넣고 기여도 낮은 것부터 하나씩 제거
단계적 선택법 전진 선택을 하되 매 단계에서 기존 변수의 제거 여부도 재검토

모형 비교 기준으로 AIC, BIC를 쓰며 값이 작을수록 좋은 모형입니다. BIC는 표본 수에 따른 벌점이 더 커서 AIC보다 더 단순한 모형을 고릅니다.

"AIC는 클수록 좋다"는 오답입니다. AIC·BIC·SSE·MSE는 작을수록, R²·수정R²는 클수록 좋습니다.

정규화(규제) 회귀

회귀계수의 크기에 벌점을 주어 과대적합을 줄이는 기법입니다.

기법 벌점 항 특징
Ridge (능형) L2 — 계수의 제곱합 계수를 0에 가깝게 줄이지만 0으로 만들지는 않음 → 변수 선택 불가. 다중공선성에 강함
Lasso L1 — 계수의 절댓값 합 일부 계수를 정확히 0으로 만들어 변수 선택 효과
Elastic Net L1 + L2 결합 변수 수가 관측치보다 많거나 변수 간 상관이 클 때 유리

Ridge vs Lasso는 매회 나옵니다. 외울 문장은 "L1 = Lasso = 절댓값 = 변수 선택(계수 0), L2 = Ridge = 제곱 = 축소만(0 아님)". 규제 강도 λ가 커질수록 계수는 작아지고 편향은 커지되 분산은 작아집니다.

로지스틱 회귀

종속변수가 범주형(성공/실패) 일 때 사용하는 분류 기법입니다. 이름은 회귀지만 분류에 씁니다.

  • 시그모이드(로지스틱) 함수로 0~1 사이 확률을 출력
  • 로짓 변환: logit(p) = ln( p / (1-p) ) = β₀ + β₁X — 좌변이 로그 오즈
  • 계수 추정은 최소제곱법이 아니라 최대우도추정법(MLE)
  • 적합도는 R² 대신 이탈도(Deviance), AIC로 판단

오즈(odds) = 성공확률 / 실패확률 = p / (1-p)

수치 예제 ①. 성공확률 p = 0.8 → 오즈 = 0.8 / 0.2 = 4 (성공이 실패보다 4배)

수치 예제 ②(오즈비). 처리군 성공 30·실패 10 → 오즈 = 30/10 = 3. 대조군 성공 20·실패 20 → 오즈 = 20/20 = 1. 오즈비(OR) = 3 / 1 = 3 → 처리군의 성공 오즈가 대조군의 3배.

수치 예제 ③(계수 해석). 회귀계수 β₁ = 0.693 이면 exp(0.693) ≈ 2.0. → X가 1 단위 증가할 때 오즈가 2배가 된다는 뜻입니다.

로지스틱 회귀의 계수는 확률의 증가량이 아니라 로그 오즈의 증가량입니다. "β₁만큼 확률이 증가한다"는 오답이고, 지수를 취한 exp(β₁)이 오즈비라는 점이 핵심입니다. 오즈비 = 1이면 두 집단의 오즈가 같아 연관이 없다는 뜻입니다.