고급 데이터 탐색
시공간 데이터, 다변량 데이터, 비정형 데이터의 특성과 각각에 맞는 탐색·시각화 기법을 다룹니다.
시공간 데이터 탐색
시공간 데이터(Spatio-Temporal Data) 는 공간적 위치 정보에 시간 정보가 함께 붙은 데이터입니다. 같은 지점을 반복 측정하므로 공간적 자기상관과 시간적 자기상관이 동시에 존재합니다.
| 데이터 타입 | 의미 | 예 |
|---|---|---|
| 포인트(Point) 데이터 | 하나의 위치 좌표로 표현 | 지진 발생 지점, 매장 위치 |
| 라인(Line) 데이터 | 시작점과 끝점을 이은 선 | 도로, 항로, 이동 경로 |
| 폴리곤(Polygon) 데이터 | 면으로 둘러싼 영역 | 행정구역, 상권 |
| 폴리라인(Polyline) 데이터 | 여러 선분이 이어진 선 | 등고선, 하천 |
| 격자(Grid·래스터) 데이터 | 공간을 일정한 셀로 나눠 값 부여 | 위성영상, 기온 분포 격자 |
주소·지명 같은 문자 정보를 좌표로 바꾸는 것을 지오코딩(Geocoding), 좌표를 주소로 바꾸는 것을 역지오코딩이라고 합니다. 좌표계는 경위도 좌표계와 UTM 같은 평면 좌표계를 씁니다.
시공간 데이터 시각화
| 기법 | 표현 방식 |
|---|---|
| 코로플레스 맵(단계구분도) | 지역 경계는 그대로 두고 값에 따라 색의 농도를 달리함 |
| 카토그램(왜상통계지도) | 값의 크기에 따라 지역의 면적·모양 자체를 왜곡 |
| 버블 맵 / 도트 맵 | 위치 위에 값 크기만큼 원을 그림 / 점 하나를 개별 사건으로 찍음 |
| 등치선도 | 같은 값을 가지는 지점을 선으로 연결 (등온선, 등고선) |
| 히트맵 | 밀도를 색의 농담으로 표현 |
코로플레스 vs 카토그램이 단골입니다. 색만 바뀌면 코로플레스, 모양이 찌그러지면 카토그램입니다. 코로플레스는 면적이 큰 지역이 과대하게 보이는 왜곡이 있고, 카토그램은 그 왜곡을 면적 변형으로 해결하지만 지형을 알아보기 어려워집니다.
다변량 데이터 탐색
변수가 셋 이상인 데이터입니다. 변수를 하나씩 보면 놓치는 변수 간 결합 구조를 봅니다.
| 목적 | 기법 |
|---|---|
| 관계 파악 | 상관분석, 정준상관분석, 회귀분석 |
| 차원 축소·구조 요약 | 주성분분석, 요인분석, 다차원척도법 |
| 집단 구분·분류 | 판별분석, 군집분석, 의사결정나무 |
다변량 시각화 기법
| 기법 | 표현 방식 |
|---|---|
| 산점도 행렬 | 모든 변수 쌍의 산점도를 격자로 배열 |
| 평행좌표 그래프(Parallel Coordinates) | 변수마다 수직축을 세우고 관측치를 꺾은선 하나로 연결 |
| 스타 차트(방사형·레이더 차트) | 중심에서 뻗은 축에 값을 찍고 이어 다각형을 만듦 |
| 체르노프 페이스 | 변수를 얼굴의 눈·코·입 크기와 모양에 대응시킴 |
| 버블차트 | x·y에 크기(와 색)를 더해 3~4개 변수를 한 평면에 |
| 모자이크 플롯 | 범주형 변수 조합의 빈도를 직사각형 면적으로 |
관측치 수가 많으면 산점도 행렬과 평행좌표 그래프는 선이 뭉쳐 읽을 수 없게 됩니다(과대 플로팅). 이때는 표본을 추출하거나 투명도·집계를 씁니다.
비정형 데이터 탐색
| 종류 | 탐색 방법 |
|---|---|
| 텍스트 | 형태소 분석 → 단어 빈도, 워드클라우드, 토픽 모델링(LDA), 감성분석, 사회연결망분석(SNA) |
| 이미지·영상 | 픽셀·색상 히스토그램, 메타데이터(EXIF), 객체 검출 후 통계 |
| 오디오 | 스펙트로그램, 주파수 성분 분석, 텍스트 변환(STT) 후 텍스트 분석 |
| 웹 문서 | 스크래핑·크롤링으로 수집 후 파싱(parsing) 하여 구조화 |
텍스트 데이터 전처리 절차
- 수집 — 크롤링·API·로그
- 정제 — HTML 태그·특수문자·숫자 제거
- 토큰화(Tokenization) — 문장을 단어·형태소 단위로 자름
- 불용어(Stopword) 제거 — 조사·관사처럼 의미 없는 단어 제거
- 어간 추출 / 표제어 추출 — 단어 형태를 통일
- 문서-단어 행렬(DTM/TDM) 생성 — 여기서부터 정형 데이터처럼 다룰 수 있음
- 가중치 부여 — TF-IDF 등
| 구분 | 방식 | 예 |
|---|---|---|
| 어간 추출 (Stemming) | 규칙으로 접사를 잘라냄 — 결과가 실제 단어가 아닐 수 있음 | studies → studi |
| 표제어 추출 (Lemmatization) | 품사·사전을 고려해 기본형으로 변환 | studies → study |
Stemming vs Lemmatization을 바꿔 놓는 문제가 나옵니다. 잘라내기만 하는 쪽이 어간 추출, 사전을 참조해 사전형 단어를 만드는 쪽이 표제어 추출입니다. 표제어 추출이 더 정확하지만 느립니다.
TF-IDF는 특정 문서에 자주 나오면서(TF↑) 여러 문서에 골고루 나오지는 않는(DF↓) 단어에 높은 가중치를 줍니다. 그래서 모든 문서에 나오는 흔한 단어는 값이 작아집니다.
비정형 데이터 탐색이 어려운 이유
| 문제 | 내용 |
|---|---|
| 스키마 부재 | 구조를 미리 알 수 없어 탐색 전에 구조화 단계가 반드시 필요 |
| 고차원성 | 단어 하나가 변수 하나가 되어 수만 차원의 희소 행렬이 만들어짐 |
| 표현 방식 의존 | 같은 뜻도 표기·어순이 달라 정규화·사전 구축이 성능을 좌우 |
| 저장 비용 | 원본 용량이 커서 원본은 객체 스토리지, 특징값만 분석 저장소에 두는 구조를 씀 |
사회연결망분석(SNA)의 기본 지표
| 지표 | 의미 |
|---|---|
| 연결 중심성(Degree) | 직접 연결된 이웃 수 |
| 근접 중심성(Closeness) | 다른 모든 노드까지의 거리가 짧은 정도 |
| 매개 중심성(Betweenness) | 다른 노드 쌍의 최단 경로 위에 놓이는 정도 — 정보의 관문 역할 |
| 위상 중심성(Eigenvector) | 영향력 있는 노드와 연결된 정도 |
| 밀도(Density) | 가능한 연결 대비 실제 연결의 비율 |
매개 중심성은 연결 수가 적어도 높을 수 있습니다. 두 집단을 잇는 유일한 다리 노드가 대표적인 예입니다.