← 개념서태블릿/PC 버전
2과목 · 빅데이터 탐색·2

분석 변수 처리

변수 선택(필터·래퍼·임베디드), 차원축소(PCA·LDA·SVD·MDS·요인분석), 파생변수와 변수 변환, 불균형 데이터 처리를 다룹니다.

변수 선택 (Feature Selection)

분석 목적에 맞는 변수만 골라내는 작업입니다. 변수가 많을수록 차원의 저주로 필요한 관측치가 기하급수적으로 늘고 과적합 위험이 커집니다.

기법 방식 대표 방법
필터 (Filter) 모델과 무관하게 통계적 측정값으로 미리 걸러냄. 빠름 정보 이득, 카이제곱 검정, 피셔 스코어, 상관계수, 분산 분석
래퍼 (Wrapper) 변수 부분집합을 만들어 모델을 반복 학습하고 예측 성능으로 평가. 느리지만 성능 좋음 전진 선택, 후진 제거, 단계적 방법, RFE, 유전 알고리즘
임베디드 (Embedded) 모델 학습 과정 자체에 변수 선택이 내장 라쏘(L1), 릿지(L2), 엘라스틱넷, 의사결정나무

래퍼 방식의 세 가지 탐색

방법 시작점 진행
전진 선택법 (Forward Selection) 변수 0개 가장 유의한 변수를 하나씩 추가, 한번 들어가면 빼지 않음
후진 제거법 (Backward Elimination) 전체 변수 기여도가 낮은 변수를 하나씩 제거, 한번 빠지면 넣지 않음
단계적 선택법 (Stepwise) 변수 0개 추가하되 매 단계 기존 변수의 제거도 재검토

"전진 선택은 이미 선택된 변수를 다시 제거한다"는 서술은 오답입니다. 추가와 제거를 둘 다 하는 것은 단계적 선택법뿐입니다.

차원 축소 (Dimension Reduction)

기법 학습 유형 핵심
주성분분석 (PCA) 비지도 분산이 최대가 되는 축을 찾아 서로 직교하는 주성분으로 사영. 정보 손실 최소화
선형판별분석 (LDA) 지도 집단 간 분산 / 집단 내 분산의 비를 최대화하는 축 — 클래스 분리가 목적
특이값 분해 (SVD) 비지도 행렬을 U·Σ·V 전치의 곱으로 분해. 정방행렬이 아니어도 적용 가능
다차원척도법 (MDS) 비지도 개체 간 거리·유사성을 보존하며 저차원 공간에 배치
요인분석 (Factor Analysis) 비지도 변수들 사이에 숨은 잠재 공통 요인을 찾아 변수를 묶음

최다 빈출 함정입니다. PCA는 분산 최대화(비지도), LDA는 클래스 분리 최대화(지도). 그리고 PCA는 관측 변수의 선형결합으로 주성분을 만들고, 요인분석은 잠재 요인이 관측 변수를 설명한다는 방향 차이가 있습니다. PCA의 주성분에는 제1주성분·제2주성분의 순서가 있지만 요인분석의 요인들은 대등합니다.

주성분 개수는 스크리 도표(scree plot)의 꺾이는 지점, 누적 기여율(보통 70~80% 이상), 고유값 1 이상 기준으로 정합니다.

변수 선택과 변수 추출의 차이

구분 방식 결과
변수 선택 (Selection) 기존 변수 중 일부를 고름 남은 변수의 원래 의미가 유지됨 — 해석이 쉬움
변수 추출 (Extraction) 기존 변수를 결합해 새 축을 만듦 (PCA·SVD 등) 정보는 잘 보존되지만 새 변수의 의미 해석이 어려움

차원 축소는 변수 추출에 해당합니다. "PCA를 하면 어떤 원래 변수가 중요한지 바로 알 수 있다"는 서술은 오답입니다.

파생변수와 요약변수

구분 정의
요약변수 원 데이터를 합계·평균 등으로 집계한 변수. 재활용성 높음 고객별 총 구매금액, 방문 횟수
파생변수 분석자가 특정 조건·논리를 부여해 새로 만든 변수. 주관적이라 논리적 타당성이 필수 주중/주말 구매지수, 체질량지수(BMI)

파생변수 생성 방법은 단위 변환, 표현형식 변환, 요약통계량 변환, 정보 추출, 변수 결합, 조건문 이용입니다.

변수 변환

방법 식·내용 결과
정규화 (Min-Max Normalization) (x − 최솟값) / (최댓값 − 최솟값) 값의 범위가 0~1
표준화 (Z-score Standardization) (x − 평균) / 표준편차 평균 0, 표준편차 1
로그 변환 자연로그를 취함 오른쪽 꼬리(양의 왜도)를 완화, 지수 관계를 선형화
제곱근 변환 루트를 취함 분산 안정화
박스-콕스 변환 (Box-Cox) 람다를 바꿔가며 최적 멱변환 탐색 정규성에 가장 가까운 변환을 자동으로 찾음
구간화 (Binning) 연속형을 구간으로 나눠 범주형으로 이상값·노이즈에 둔감해짐, 정보 손실 발생

정규화 vs 표준화는 매년 나옵니다. 정규화는 범위를 0~1로 고정하므로 이상값에 취약하고, 표준화는 평균 0·표준편차 1로 맞추므로 범위가 고정되지 않고 음수도 나옵니다. "표준화하면 0과 1 사이가 된다"는 오답입니다.

로그 변환은 양수 값에만 적용할 수 있고, 박스-콕스에서 람다가 0이면 로그 변환과 같아집니다.

불균형 데이터 처리

한 클래스가 압도적으로 많으면 정확도는 높아 보이지만 소수 클래스를 전혀 못 맞히는 모형이 만들어집니다.

기법 방식 부작용
과소표집 (Under-sampling) 다수 클래스를 줄여 소수 클래스에 맞춤 (랜덤, ENN, 토멕 링크, CNN) 다수 클래스의 정보 손실
과대표집 (Over-sampling) 소수 클래스를 늘려 다수 클래스에 맞춤 (랜덤 복원추출, SMOTE, Borderline-SMOTE, ADASYN) 같은 값 반복으로 과적합, 노이즈 증폭
임곗값 이동 (Threshold Moving) 학습은 그대로 두고 분류 기준값만 소수 클래스 쪽으로 조정 학습 데이터를 건드리지 않음
앙상블 기법 여러 모형을 결합해 소수 클래스 검출력을 높임 계산 비용 증가

부작용을 뒤집어 놓은 선택지가 단골입니다. 정보 손실은 과소표집, 과적합은 과대표집입니다.

SMOTE의 원리

SMOTE(Synthetic Minority Over-sampling Technique) 는 소수 클래스를 그대로 복사하지 않고 새 합성 데이터를 만들어 냅니다.

  1. 소수 클래스 관측치 하나를 고른다
  2. 그 점의 K개 최근접 이웃(같은 소수 클래스) 중 하나를 무작위로 고른다
  3. 두 점을 잇는 선분 위의 임의 지점을 새 데이터로 생성한다

예를 들어 소수 클래스 점 A = (10, 20), 이웃 B = (14, 28) 이고 난수가 0.5라면 새 표본은 (12, 24) 가 됩니다.

"SMOTE는 소수 클래스를 단순 복제한다"는 오답입니다. 단순 복제는 랜덤 과대표집이고, SMOTE는 보간으로 합성합니다. 그래서 랜덤 복제보다 과적합이 덜하지만, 클래스 경계가 겹치면 노이즈를 늘릴 수 있습니다.

불균형 데이터에서는 평가지표도 정확도 대신 정밀도·재현율·F1·AUC를 봅니다.