분석 절차 수립
분석 모형 설계 4단계 절차, 모형 선정 기준, 지도·비지도·강화학습의 구분, 훈련·검증·평가 데이터 분할과 교차 검증을 다룹니다.
분석 모형 설계 절차
| 단계 | 하는 일 | 산출물 |
|---|---|---|
| ① 요건 정의 | 분석 과제 정의, 요구사항 도출, 데이터 확보 계획, 성공 기준 합의 | 분석 요건 정의서 |
| ② 모델링 | 데이터 전처리 → 변수 선택 → 모형 선정 → 학습(모형 구축) | 모델링 결과 보고서 |
| ③ 검증·테스트 | 검증 데이터로 성능 확인, 운영 환경에 시범 적용, 비즈니스 영향도 평가 | 검증 결과 보고서 |
| ④ 운영·적용 | 운영 시스템 반영, 모니터링 계획, 주기적 재학습 | 운영 적용 계획서 |
"모델링 → 검증·테스트" 순서를 뒤집은 선택지가 단골입니다. 검증은 모형을 만든 뒤에 하고, 검증 결과가 나쁘면 요건 정의·모델링으로 되돌아가는 반복(iteration) 구조입니다.
요건 정의 단계의 세부 활동
- 분석 과제 정의 — 문제를 분석 가능한 형태(예측·분류·군집)로 번역
- 요구사항 도출 — 데이터·모형·성능·운영 요구사항
- 데이터 확보 계획 — 내부/외부 데이터, 수집 가능성, 개인정보 이슈
- 성공 기준 정의 — 정확도, 매출 증가율처럼 측정 가능한 지표
분석 모형 선정 기준
| 기준 | 내용 |
|---|---|
| 분석 목적 | 예측 · 분류 · 군집 · 연관 · 차원 축소 중 무엇인가 |
| 종속변수 유형 | 연속형 → 회귀 / 범주형 → 분류 / 없음 → 비지도 |
| 해석 가능성 | 규제·설명이 필요하면 회귀·의사결정나무, 성능 우선이면 앙상블·딥러닝 |
| 데이터 규모 | 소규모 → 통계 모형, 대규모 → 머신러닝·딥러닝 |
| 가정 충족 여부 | 정규성·등분산성 등 통계 모형의 가정을 만족하는가 |
| 구분 | 통계 기반 모형 | 머신러닝 기반 모형 |
|---|---|---|
| 출발점 | 모집단에 대한 가정과 분포 | 데이터로부터의 학습 |
| 관심 | 계수의 유의성, 인과 설명 | 예측 정확도 |
| 예 | 회귀분석, 분산분석, 시계열 | 의사결정나무, SVM, 앙상블, 신경망 |
학습 방법의 구분
| 구분 | 정답(레이블) | 목적 | 대표 기법 |
|---|---|---|---|
| 지도학습 | 있음 | 입력 → 출력 관계 학습 | 회귀분석, 로지스틱 회귀, 의사결정나무, KNN, 나이브베이즈, SVM, 인공신경망, 랜덤포레스트 |
| 비지도학습 | 없음 | 구조·패턴 발견 | 군집분석(K-평균·계층적), 연관분석, 주성분분석(PCA), SOM, 오토인코더 |
| 강화학습 | 없음(보상) | 누적 보상 최대화 정책 학습 | Q-러닝, SARSA, DQN |
자주 틀리는 배치: SVM은 지도학습, 주성분분석과 연관분석은 비지도학습, 자기조직화지도(SOM)는 비지도학습입니다. 강화학습은 정답 대신 보상(reward) 과 에이전트·환경·행동·상태로 설명한다는 점을 기억합니다.
변수 유형에 따른 기법 선택
| 독립변수 | 종속변수 | 적합한 기법 |
|---|---|---|
| 연속형 | 연속형 | 단순·다중 회귀분석 |
| 연속형 | 범주형 | 로지스틱 회귀, 판별분석, SVM |
| 범주형 | 범주형 | 카이제곱 검정, 의사결정나무(CHAID) |
| 범주형 | 연속형 | 분산분석(ANOVA), t-검정 |
데이터 분할
| 데이터 | 역할 | 주의 |
|---|---|---|
| 훈련(Training) | 모형의 모수를 추정하고 학습 | 통상 전체의 50~70% |
| 검증(Validation) | 초매개변수 조정·모형 선택, 과대적합 점검 | 학습에 직접 쓰지 않음 |
| 평가(Test) | 최종 성능의 일반화 오차 추정 | 딱 한 번만, 조정에 절대 쓰지 않음 |
일반적 비율은 훈련 : 검증 : 평가 = 5 : 3 : 2 또는 6 : 2 : 2, 검증을 따로 두지 않으면 훈련 : 평가 = 7 : 3 입니다.
"검증 데이터로 최종 성능을 보고한다"는 서술은 오답입니다. 검증 데이터는 모형을 고르는 데 이미 쓰였으므로 낙관적으로 편향됩니다. 최종 보고는 평가 데이터로 합니다.
데이터가 적을 때 — 재표본추출
| 방법 | 절차 | 특징 |
|---|---|---|
| 홀드아웃(Holdout) | 한 번 임의 분할해 학습·평가 | 간단하지만 분할 운에 따라 결과가 흔들림 |
| K-폴드 교차검증 | K등분 → 1개를 평가, K-1개로 학습 → K번 반복 후 평균 | 가장 널리 쓰임. 보통 K=5 또는 10 |
| LOOCV | K = n, 관측치 하나만 평가에 사용 | 데이터가 매우 적을 때. 계산량 큼 |
| 부트스트랩 | 복원추출로 n개를 뽑아 훈련 집합 구성 | 한 번도 뽑히지 않을 확률 약 36.8% → 이들이 검증용 |
| 계층별 K-폴드 | 폴드마다 클래스 비율을 유지하며 분할 | 클래스 불균형 데이터에 필수 |
부트스트랩의 36.8%는 (1 - 1/n)^n → e⁻¹ ≈ 0.368 에서 나옵니다. "복원추출"이 부트스트랩, "비복원 분할"이 교차검증이라는 대비가 시험 포인트입니다.
모형 정의 — 모수와 초매개변수
| 구분 | 정의 | 예 |
|---|---|---|
| 모수(Parameter) | 데이터로부터 학습되는 값 | 회귀계수, 신경망 가중치 |
| 초매개변수(Hyperparameter) | 사람이 미리 지정하는 값 | K-평균의 K, 나무의 최대 깊이, 학습률, 은닉층 수 |
초매개변수 탐색은 그리드 서치(격자 탐색), 랜덤 서치, 베이지안 최적화로 하고, 그 성능 비교의 근거가 되는 것이 검증 데이터입니다.
"K-평균의 K는 학습으로 자동 결정된다"는 오답입니다. K는 초매개변수여서 분석자가 엘보우·실루엣 등을 보고 정합니다.
과대적합과 과소적합
| 구분 | 훈련 오차 | 평가 오차 | 원인 | 대응 |
|---|---|---|---|---|
| 과소적합(Underfitting) | 큼 | 큼 | 모형이 너무 단순, 학습 부족 | 변수 추가, 모형 복잡도 상향 |
| 과대적합(Overfitting) | 작음 | 큼 | 모형이 너무 복잡, 데이터 부족·잡음 학습 | 정규화, 가지치기, 드롭아웃, 데이터 증강, 조기 종료 |
편향-분산 트레이드오프에서 과소적합은 편향(bias)이 크고, 과대적합은 분산(variance)이 큽니다.
"훈련 정확도가 99%인데 평가 정확도가 65%"라는 상황이 주어지면 답은 언제나 과대적합이고, 처방은 모형을 더 단순하게 만드는 쪽입니다.