← 개념서태블릿/PC 버전
2과목 · 빅데이터 탐색·1

데이터 정제

결측값의 세 유형(MCAR·MAR·MNAR)과 대치 방법, 이상값 탐지 기법과 처리 전략을 다룹니다.

데이터 정제란

수집한 데이터의 결측값·이상값·노이즈를 찾아내 삭제하거나 채워 넣어 분석 가능한 상태로 만드는 작업입니다. 데이터 분석 과정에서 시간이 가장 많이 드는 단계이고, 모든 데이터에 일관되게 적용해야 합니다.

정제 절차는 오류 원인 파악 → 정제 여부 결정 → 정제 방법 결정 순입니다.

오류 의미
결측값(Missing value) 값이 아예 비어 있음 (NA, NULL, 999 같은 코드값)
이상값(Outlier) 정상 범위에서 크게 벗어난 값
노이즈(Noise) 실제 값과 측정값의 차이, 무작위 오차

결측값과 이상값을 섞어 묻습니다. 비어 있으면 결측값, 있는데 튀면 이상값입니다. "999로 입력된 나이"는 값이 있으므로 이상값이자, 코드로 위장한 결측값이기도 합니다.

결측값의 세 유형

유형 정의
완전 무작위 결측 (MCAR) 결측 여부가 다른 변수·자기 값과 모두 무관 설문지 한 장이 우연히 유실
무작위 결측 (MAR) 결측 여부가 다른 관측 변수로 설명됨 (자기 값과는 무관) 여성이 소득을 덜 응답 — 성별로 설명 가능
비무작위 결측 (MNAR) 결측 여부가 결측된 값 자체에 달려 있음 고소득자일수록 소득을 응답하지 않음

셋을 가르는 기준은 "결측 원인이 어디에 있는가"입니다. MCAR = 아무 관련 없음, MAR = 관측된 다른 변수와 관련, MNAR = 없어진 값 자신과 관련. MAR을 "완전히 무작위"로 서술한 선택지가 단골 오답입니다.

결측값 처리

1. 단순 삭제

방법 내용
완전 제거법 (Listwise) 결측이 하나라도 있으면 그 행 전체 삭제
쌍별 제거법 (Pairwise) 계산에 쓰이는 변수에만 결측이 없으면 그 관측치를 사용

MCAR일 때만 안전하고, 결측 비율이 크면 표본이 급감해 검정력이 떨어집니다.

2. 단순 대치법 (Single Imputation)

방법 내용
완전 분석법 결측이 없는 자료만 사용 (삭제와 사실상 같음)
비조건부 평균 대치 관측된 값의 전체 평균으로 채움
조건부 평균 대치 (회귀 대치) 다른 변수로 회귀식을 세워 예측값으로 채움
단순 확률 대치 확률 요소를 넣어 채움 — Hot-deck(같은 조사 내 유사 응답자 값), Cold-deck(외부·과거 자료 값), 최근방 대치(KNN)

평균 대치는 계산이 쉽지만 분산을 과소추정하고 분포를 왜곡합니다.

3. 다중 대치법 (Multiple Imputation)

대치(Imputation) → 분석(Analysis) → 결합(Combination) 3단계를 거칩니다. 하나의 값이 아니라 여러 개의 완전 자료를 만들어 각각 분석한 뒤 결과를 합쳐, 단순 대치가 놓치는 대치의 불확실성까지 반영합니다.

4. EM 알고리즘

E 단계(기댓값 단계)에서 결측값의 기댓값을 계산하고, M 단계(최대화 단계)에서 그 값으로 모수의 최대가능도 추정치를 갱신합니다. 두 단계를 수렴할 때까지 반복합니다.

"다중 대치법의 3단계"와 "EM의 2단계"를 바꿔 놓은 선택지가 나옵니다. 다중 대치는 대치·분석·결합, EM은 기댓값·최대화입니다.

이상값 탐지

기법 기준
ESD (Extreme Studentized Deviation) 평균에서 표준편차 3배 이상 떨어진 값 (정규분포 기준 약 99.7% 밖)
사분위수 / IQR Q1 − 1.5×IQR 미만 또는 Q3 + 1.5×IQR 초과
기하평균 기준 기하평균 ± 2.5×표준편차 밖
딕슨의 Q 검정 표본 수가 적을 때(대략 30개 미만) 사용
그럽스 T 검정 정규분포를 따르는 단변량 자료의 이상값 검정
카이제곱 검정 분포를 알고 있을 때 사용
마할라노비스 거리 변수 간 상관관계를 고려한 거리 — 다변량 이상값
LOF (Local Outlier Factor) 국소 밀도를 이웃과 비교, 값이 1보다 크게 클수록 이상값
iForest (Isolation Forest) 무작위 분할로 고립시켰을 때 경로 길이가 짧은 관측치를 이상값으로 판단

시각화로는 박스플롯, 산점도, 히스토그램, 시계열 차트, 확률밀도함수를 씁니다.

유클리드 거리 대신 마할라노비스 거리를 쓰는 이유를 묻습니다. 변수의 분산과 상관을 반영해 타원형 분포에서도 옳게 판정하기 때문입니다.

IQR 경계 계산 — 계산 문제 유형

Q1 = 25, Q3 = 45 인 자료가 있다고 하면

  1. IQR = Q3 − Q1 = 45 − 25 = 20
  2. 1.5 × IQR = 30
  3. 하한 = Q1 − 30 = −5, 상한 = Q3 + 30 = 75

따라서 −5 미만 또는 75 초과가 이상값입니다. 값 80은 이상값, 값 0은 정상입니다.

박스플롯의 수염(whisker)은 이 하한·상한 안쪽의 실제 최솟값·최댓값까지만 뻗고, 밖의 점이 이상값으로 찍힙니다.

계수를 1.5가 아니라 3으로 바꿔 놓거나, ESD의 를 1.5σ로 바꿔 놓는 함정이 흔합니다. IQR은 1.5배, ESD는 3표준편차로 외웁니다.

이상값 처리

방법 내용
삭제 극단값 절단(trimming) — 상·하위 일정 비율 제거. 표본이 줄어듦
대체 (조정) 극단값 조정(winsorizing) — 경계값으로 바꿔 넣음. 표본 수 유지
변환 로그·제곱근 변환으로 극단값의 영향을 줄임
분류(그룹화) 이상값만 따로 묶어 별도 모형으로 분석

단순 오기·입력 오류라면 삭제하지만, 의미 있는 극단값(불량 탐지, 사기 거래)은 절대 지우지 않습니다 — 그 자체가 분석 대상입니다.

데이터 일관성 점검

항목 확인 내용
유효성(Validity) 값이 정의된 범위·형식 안에 있는가
완전성(Completeness) 필수 항목이 채워져 있는가
일관성(Consistency) 같은 개념이 시스템 간 같은 값인가
정확성(Accuracy) 실제 사실과 일치하는가
유일성(Uniqueness) 중복 레코드가 없는가