← 개념서태블릿/PC 버전
3과목 · 빅데이터 모델링·5

군집분석

계층적 군집의 연결법과 덴드로그램, K-평균 군집의 절차와 단점, 엘보우·실루엣으로 K 결정, DBSCAN, 혼합분포군집(EM), SOM을 다룹니다.

군집분석의 성격

정답(레이블) 없이 관측치 간 유사성(거리) 을 기준으로 비슷한 것끼리 묶는 비지도학습입니다. 군집 내 유사성은 최대, 군집 간 유사성은 최소가 되도록 나눕니다.

군집분석은 종속변수가 없습니다. "군집분석은 사전에 정의된 집단으로 분류한다"는 서술은 분류분석(지도학습) 의 설명이라 오답입니다.

거리 척도

척도 대상 내용
유클리드 거리 연속형 두 점의 직선거리. 가장 기본
맨하탄 거리 연속형 좌표 차이의 절댓값 합
민코프스키 거리 연속형 m=1이면 맨하탄, m=2이면 유클리드
마할라노비스 거리 연속형 변수 간 상관과 분산을 반영한 통계적 거리
표준화 거리 연속형 표준편차로 나눠 척도 차이 제거
자카드 계수·단순일치계수 범주형 일치 항목 비율
코사인 유사도 문서·희소 벡터 벡터 방향의 유사성

변수의 단위가 다르면 결과가 왜곡되므로 군집분석 전에는 표준화가 필요합니다. 상관을 고려하는 거리는 마할라노비스라는 점이 단답형 포인트입니다.

계층적 군집분석

가까운 것부터 차례로 병합하는 병합적(agglomerative, 상향식) 방식과, 전체에서 쪼개 나가는 분할적(divisive, 하향식) 방식이 있습니다. 결과는 덴드로그램(dendrogram) 으로 표현하고, 원하는 높이에서 잘라 군집 수를 정합니다.

연결법 군집 간 거리 정의 특징
최단 연결법(단일, Single) 두 군집 관측치 쌍 중 가장 가까운 거리 고리 모양 군집도 찾지만 사슬 효과(chaining) 로 길게 늘어짐
최장 연결법(완전, Complete) 쌍 중 가장 먼 거리 크기가 비슷한 조밀한 군집, 이상값에 민감
평균 연결법(Average) 모든 쌍의 거리 평균 단일·완전의 중간, 안정적
중심 연결법(Centroid) 두 군집 중심(평균 벡터) 간 거리 계산이 간단
와드 연결법(Ward) 병합 시 군집 내 오차제곱합(SSE) 증가량이 최소가 되도록 크기가 고른 군집, 실무에서 가장 널리 쓰임

연결법 구분 문제는 매회 나옵니다. 최단 = 가장 가까운 쌍, 최장 = 가장 먼 쌍, 중심 = 중심 간 거리, 와드 = 오차제곱합 증가 최소. 특히 와드 연결법을 "군집 중심 간 거리"로 설명한 선택지가 단골 오답입니다.

계층적 군집의 장점은 군집 수를 미리 정하지 않아도 되고 덴드로그램으로 구조를 볼 수 있다는 점, 단점은 계산량이 커서 대용량에 부적합하고 한 번 병합하면 되돌릴 수 없다는 점입니다.

비계층적 군집 — K-평균

절차

  1. 군집 수 K를 지정한다
  2. 초기 중심(seed) K개를 임의로 선택한다
  3. 각 관측치를 가장 가까운 중심의 군집에 배정한다
  4. 각 군집의 중심(평균)을 다시 계산한다
  5. 중심이 더 이상 변하지 않을 때까지 ③~④를 반복한다

K-평균의 단점 — 시험 최다 출제

단점 설명
K를 미리 지정해야 함 적정 군집 수를 모르면 곤란
초기값(초기 중심)에 민감 시작점에 따라 결과가 달라지고 지역 최적해에 빠질 수 있음
이상값(outlier)에 민감 중심이 평균이라 극단값에 끌려감 → 대안은 K-메도이드(중앙값·대표 관측치 사용)
볼록하지 않은 모양의 군집을 못 찾음 구형(원형) 군집만 잘 찾음
범주형 변수에 부적합 평균을 정의할 수 없음 → K-모드 사용

"K-평균은 군집 수를 자동으로 찾아준다", "이상값에 강건하다"는 전형적 오답입니다. 초기값 민감성은 여러 번 반복 실행하거나 K-means++ 초기화로 완화합니다. 반면 계층적 군집보다 계산이 빨라 대용량에 유리하다는 것은 K-평균의 장점입니다.

군집 수 K의 결정

방법 판단 기준
엘보우(Elbow) 기법 K를 늘려가며 군집 내 제곱합(SSE/WSS)을 그려, 감소폭이 급격히 꺾이는 팔꿈치 지점을 선택
실루엣(Silhouette) 계수 -1 ~ 1. 1에 가까울수록 잘 분리, 0 근처면 경계에 걸침, 음수면 잘못 배정. 평균 실루엣이 최대인 K 선택
덴드로그램 계층적 군집에서 적당한 높이로 절단
Dunn 지수 군집 간 최소거리 / 군집 내 최대거리 — 클수록 좋음

SSE는 K가 커지면 항상 감소합니다(K = n이면 0). 그래서 "SSE가 최소인 K를 고른다"는 오답이고, 감소가 꺾이는 지점을 고르는 것이 엘보우 기법입니다.

DBSCAN — 밀도 기반 군집

입력 파라미터는 반경 ε(epsilon) 과 최소 점 개수 MinPts 입니다.

점 구분 정의
핵심점(Core point) 반경 ε 안에 MinPts 이상의 점이 있는 점
경계점(Border point) 핵심점의 이웃이지만 자신은 MinPts를 못 채운 점
잡음점(Noise) 핵심점도 경계점도 아닌 점 — 어느 군집에도 속하지 않음

장점: 군집 수를 미리 정하지 않아도 되고, 임의의 모양(비볼록) 군집을 찾아내며, 이상값을 잡음으로 분리합니다. 단점: ε·MinPts 설정이 어렵고, 밀도가 서로 다른 군집이 섞여 있으면 성능이 떨어집니다.

K-평균 vs DBSCAN: K를 지정하는가(K-평균 예, DBSCAN 아니오), 이상값을 별도로 빼주는가(K-평균 아니오, DBSCAN 예), 비구형 군집을 찾는가(K-평균 아니오, DBSCAN 예).

혼합분포군집 (Mixture Distribution Clustering)

데이터가 k개의 확률분포(주로 정규분포)의 가중합에서 나왔다고 보고, 각 관측치가 어느 분포에서 왔는지를 확률로 추정합니다.

  • 모수 추정은 EM 알고리즘: E-단계(현재 모수로 소속 확률의 기대값 계산) ↔ M-단계(그 확률로 모수를 최대우도 갱신)를 수렴까지 반복
  • 소프트 군집: 한 관측치가 여러 군집에 소속 확률로 걸침 (K-평균은 하드 군집)
  • 이상값에 민감하고, 군집 크기가 너무 작으면 추정이 불안정

EM의 E와 M을 뒤집어 놓은 선택지에 주의합니다. E = Expectation(기대값 계산), M = Maximization(모수 갱신) 이고, 로그우도는 반복마다 증가(비감소) 합니다.

자기조직화지도 (SOM)

코호넨(Kohonen)이 제안한 비지도 인공신경망으로, 고차원 데이터를 2차원 격자(맵) 에 위상 관계를 보존하며 사상합니다.

  • 구조는 입력층 + 경쟁층(출력층) 2층
  • 승자독식(winner-take-all): 입력과 가장 가까운 노드(BMU)와 그 이웃의 가중치만 갱신
  • 역전파를 쓰지 않아 학습이 빠르고, 시각화·차원 축소에 유리

SOM은 비지도학습이며 역전파를 사용하지 않습니다. "SOM은 오차 역전파로 학습하는 지도학습 신경망"이라는 선택지는 오답입니다. 인접한 출력 노드가 비슷한 입력에 반응한다는 위상 보존이 SOM의 특징입니다.