← 개념서태블릿/PC 버전
3과목 · 빅데이터 모델링·1

분석 절차 수립

분석 모형 설계 4단계 절차, 모형 선정 기준, 지도·비지도·강화학습의 구분, 훈련·검증·평가 데이터 분할과 교차 검증을 다룹니다.

분석 모형 설계 절차

단계 하는 일 산출물
① 요건 정의 분석 과제 정의, 요구사항 도출, 데이터 확보 계획, 성공 기준 합의 분석 요건 정의서
② 모델링 데이터 전처리 → 변수 선택 → 모형 선정 → 학습(모형 구축) 모델링 결과 보고서
③ 검증·테스트 검증 데이터로 성능 확인, 운영 환경에 시범 적용, 비즈니스 영향도 평가 검증 결과 보고서
④ 운영·적용 운영 시스템 반영, 모니터링 계획, 주기적 재학습 운영 적용 계획서

"모델링 → 검증·테스트" 순서를 뒤집은 선택지가 단골입니다. 검증은 모형을 만든 뒤에 하고, 검증 결과가 나쁘면 요건 정의·모델링으로 되돌아가는 반복(iteration) 구조입니다.

요건 정의 단계의 세부 활동

  1. 분석 과제 정의 — 문제를 분석 가능한 형태(예측·분류·군집)로 번역
  2. 요구사항 도출 — 데이터·모형·성능·운영 요구사항
  3. 데이터 확보 계획 — 내부/외부 데이터, 수집 가능성, 개인정보 이슈
  4. 성공 기준 정의 — 정확도, 매출 증가율처럼 측정 가능한 지표

분석 모형 선정 기준

기준 내용
분석 목적 예측 · 분류 · 군집 · 연관 · 차원 축소 중 무엇인가
종속변수 유형 연속형 → 회귀 / 범주형 → 분류 / 없음 → 비지도
해석 가능성 규제·설명이 필요하면 회귀·의사결정나무, 성능 우선이면 앙상블·딥러닝
데이터 규모 소규모 → 통계 모형, 대규모 → 머신러닝·딥러닝
가정 충족 여부 정규성·등분산성 등 통계 모형의 가정을 만족하는가
구분 통계 기반 모형 머신러닝 기반 모형
출발점 모집단에 대한 가정과 분포 데이터로부터의 학습
관심 계수의 유의성, 인과 설명 예측 정확도
회귀분석, 분산분석, 시계열 의사결정나무, SVM, 앙상블, 신경망

학습 방법의 구분

구분 정답(레이블) 목적 대표 기법
지도학습 있음 입력 → 출력 관계 학습 회귀분석, 로지스틱 회귀, 의사결정나무, KNN, 나이브베이즈, SVM, 인공신경망, 랜덤포레스트
비지도학습 없음 구조·패턴 발견 군집분석(K-평균·계층적), 연관분석, 주성분분석(PCA), SOM, 오토인코더
강화학습 없음(보상) 누적 보상 최대화 정책 학습 Q-러닝, SARSA, DQN

자주 틀리는 배치: SVM은 지도학습, 주성분분석과 연관분석은 비지도학습, 자기조직화지도(SOM)는 비지도학습입니다. 강화학습은 정답 대신 보상(reward)에이전트·환경·행동·상태로 설명한다는 점을 기억합니다.

변수 유형에 따른 기법 선택

독립변수 종속변수 적합한 기법
연속형 연속형 단순·다중 회귀분석
연속형 범주형 로지스틱 회귀, 판별분석, SVM
범주형 범주형 카이제곱 검정, 의사결정나무(CHAID)
범주형 연속형 분산분석(ANOVA), t-검정

데이터 분할

데이터 역할 주의
훈련(Training) 모형의 모수를 추정하고 학습 통상 전체의 50~70%
검증(Validation) 초매개변수 조정·모형 선택, 과대적합 점검 학습에 직접 쓰지 않음
평가(Test) 최종 성능의 일반화 오차 추정 딱 한 번만, 조정에 절대 쓰지 않음

일반적 비율은 훈련 : 검증 : 평가 = 5 : 3 : 2 또는 6 : 2 : 2, 검증을 따로 두지 않으면 훈련 : 평가 = 7 : 3 입니다.

"검증 데이터로 최종 성능을 보고한다"는 서술은 오답입니다. 검증 데이터는 모형을 고르는 데 이미 쓰였으므로 낙관적으로 편향됩니다. 최종 보고는 평가 데이터로 합니다.

데이터가 적을 때 — 재표본추출

방법 절차 특징
홀드아웃(Holdout) 한 번 임의 분할해 학습·평가 간단하지만 분할 운에 따라 결과가 흔들림
K-폴드 교차검증 K등분 → 1개를 평가, K-1개로 학습 → K번 반복 후 평균 가장 널리 쓰임. 보통 K=5 또는 10
LOOCV K = n, 관측치 하나만 평가에 사용 데이터가 매우 적을 때. 계산량 큼
부트스트랩 복원추출로 n개를 뽑아 훈련 집합 구성 한 번도 뽑히지 않을 확률 약 36.8% → 이들이 검증용
계층별 K-폴드 폴드마다 클래스 비율을 유지하며 분할 클래스 불균형 데이터에 필수

부트스트랩의 36.8%는 (1 - 1/n)^n → e⁻¹ ≈ 0.368 에서 나옵니다. "복원추출"이 부트스트랩, "비복원 분할"이 교차검증이라는 대비가 시험 포인트입니다.

모형 정의 — 모수와 초매개변수

구분 정의
모수(Parameter) 데이터로부터 학습되는 회귀계수, 신경망 가중치
초매개변수(Hyperparameter) 사람이 미리 지정하는 K-평균의 K, 나무의 최대 깊이, 학습률, 은닉층 수

초매개변수 탐색은 그리드 서치(격자 탐색), 랜덤 서치, 베이지안 최적화로 하고, 그 성능 비교의 근거가 되는 것이 검증 데이터입니다.

"K-평균의 K는 학습으로 자동 결정된다"는 오답입니다. K는 초매개변수여서 분석자가 엘보우·실루엣 등을 보고 정합니다.

과대적합과 과소적합

구분 훈련 오차 평가 오차 원인 대응
과소적합(Underfitting) 모형이 너무 단순, 학습 부족 변수 추가, 모형 복잡도 상향
과대적합(Overfitting) 작음 모형이 너무 복잡, 데이터 부족·잡음 학습 정규화, 가지치기, 드롭아웃, 데이터 증강, 조기 종료

편향-분산 트레이드오프에서 과소적합은 편향(bias)이 크고, 과대적합은 분산(variance)이 큽니다.

"훈련 정확도가 99%인데 평가 정확도가 65%"라는 상황이 주어지면 답은 언제나 과대적합이고, 처방은 모형을 더 단순하게 만드는 쪽입니다.