← 개념서태블릿/PC 버전
2과목 · 빅데이터 탐색·4

고급 데이터 탐색

시공간 데이터, 다변량 데이터, 비정형 데이터의 특성과 각각에 맞는 탐색·시각화 기법을 다룹니다.

시공간 데이터 탐색

시공간 데이터(Spatio-Temporal Data) 는 공간적 위치 정보에 시간 정보가 함께 붙은 데이터입니다. 같은 지점을 반복 측정하므로 공간적 자기상관시간적 자기상관이 동시에 존재합니다.

데이터 타입 의미
포인트(Point) 데이터 하나의 위치 좌표로 표현 지진 발생 지점, 매장 위치
라인(Line) 데이터 시작점과 끝점을 이은 선 도로, 항로, 이동 경로
폴리곤(Polygon) 데이터 면으로 둘러싼 영역 행정구역, 상권
폴리라인(Polyline) 데이터 여러 선분이 이어진 선 등고선, 하천
격자(Grid·래스터) 데이터 공간을 일정한 셀로 나눠 값 부여 위성영상, 기온 분포 격자

주소·지명 같은 문자 정보를 좌표로 바꾸는 것을 지오코딩(Geocoding), 좌표를 주소로 바꾸는 것을 역지오코딩이라고 합니다. 좌표계는 경위도 좌표계와 UTM 같은 평면 좌표계를 씁니다.

시공간 데이터 시각화

기법 표현 방식
코로플레스 맵(단계구분도) 지역 경계는 그대로 두고 값에 따라 색의 농도를 달리함
카토그램(왜상통계지도) 값의 크기에 따라 지역의 면적·모양 자체를 왜곡
버블 맵 / 도트 맵 위치 위에 값 크기만큼 원을 그림 / 점 하나를 개별 사건으로 찍음
등치선도 같은 값을 가지는 지점을 선으로 연결 (등온선, 등고선)
히트맵 밀도를 색의 농담으로 표현

코로플레스 vs 카토그램이 단골입니다. 색만 바뀌면 코로플레스, 모양이 찌그러지면 카토그램입니다. 코로플레스는 면적이 큰 지역이 과대하게 보이는 왜곡이 있고, 카토그램은 그 왜곡을 면적 변형으로 해결하지만 지형을 알아보기 어려워집니다.

다변량 데이터 탐색

변수가 셋 이상인 데이터입니다. 변수를 하나씩 보면 놓치는 변수 간 결합 구조를 봅니다.

목적 기법
관계 파악 상관분석, 정준상관분석, 회귀분석
차원 축소·구조 요약 주성분분석, 요인분석, 다차원척도법
집단 구분·분류 판별분석, 군집분석, 의사결정나무

다변량 시각화 기법

기법 표현 방식
산점도 행렬 모든 변수 쌍의 산점도를 격자로 배열
평행좌표 그래프(Parallel Coordinates) 변수마다 수직축을 세우고 관측치를 꺾은선 하나로 연결
스타 차트(방사형·레이더 차트) 중심에서 뻗은 축에 값을 찍고 이어 다각형을 만듦
체르노프 페이스 변수를 얼굴의 눈·코·입 크기와 모양에 대응시킴
버블차트 x·y에 크기(와 색)를 더해 3~4개 변수를 한 평면에
모자이크 플롯 범주형 변수 조합의 빈도를 직사각형 면적으로

관측치 수가 많으면 산점도 행렬과 평행좌표 그래프는 선이 뭉쳐 읽을 수 없게 됩니다(과대 플로팅). 이때는 표본을 추출하거나 투명도·집계를 씁니다.

비정형 데이터 탐색

종류 탐색 방법
텍스트 형태소 분석 → 단어 빈도, 워드클라우드, 토픽 모델링(LDA), 감성분석, 사회연결망분석(SNA)
이미지·영상 픽셀·색상 히스토그램, 메타데이터(EXIF), 객체 검출 후 통계
오디오 스펙트로그램, 주파수 성분 분석, 텍스트 변환(STT) 후 텍스트 분석
웹 문서 스크래핑·크롤링으로 수집 후 파싱(parsing) 하여 구조화

텍스트 데이터 전처리 절차

  1. 수집 — 크롤링·API·로그
  2. 정제 — HTML 태그·특수문자·숫자 제거
  3. 토큰화(Tokenization) — 문장을 단어·형태소 단위로 자름
  4. 불용어(Stopword) 제거 — 조사·관사처럼 의미 없는 단어 제거
  5. 어간 추출 / 표제어 추출 — 단어 형태를 통일
  6. 문서-단어 행렬(DTM/TDM) 생성 — 여기서부터 정형 데이터처럼 다룰 수 있음
  7. 가중치 부여 — TF-IDF 등
구분 방식
어간 추출 (Stemming) 규칙으로 접사를 잘라냄 — 결과가 실제 단어가 아닐 수 있음 studies → studi
표제어 추출 (Lemmatization) 품사·사전을 고려해 기본형으로 변환 studies → study

Stemming vs Lemmatization을 바꿔 놓는 문제가 나옵니다. 잘라내기만 하는 쪽이 어간 추출, 사전을 참조해 사전형 단어를 만드는 쪽이 표제어 추출입니다. 표제어 추출이 더 정확하지만 느립니다.

TF-IDF는 특정 문서에 자주 나오면서(TF↑) 여러 문서에 골고루 나오지는 않는(DF↓) 단어에 높은 가중치를 줍니다. 그래서 모든 문서에 나오는 흔한 단어는 값이 작아집니다.

비정형 데이터 탐색이 어려운 이유

문제 내용
스키마 부재 구조를 미리 알 수 없어 탐색 전에 구조화 단계가 반드시 필요
고차원성 단어 하나가 변수 하나가 되어 수만 차원의 희소 행렬이 만들어짐
표현 방식 의존 같은 뜻도 표기·어순이 달라 정규화·사전 구축이 성능을 좌우
저장 비용 원본 용량이 커서 원본은 객체 스토리지, 특징값만 분석 저장소에 두는 구조를 씀

사회연결망분석(SNA)의 기본 지표

지표 의미
연결 중심성(Degree) 직접 연결된 이웃 수
근접 중심성(Closeness) 다른 모든 노드까지의 거리가 짧은 정도
매개 중심성(Betweenness) 다른 노드 쌍의 최단 경로 위에 놓이는 정도 — 정보의 관문 역할
위상 중심성(Eigenvector) 영향력 있는 노드와 연결된 정도
밀도(Density) 가능한 연결 대비 실제 연결의 비율

매개 중심성은 연결 수가 적어도 높을 수 있습니다. 두 집단을 잇는 유일한 다리 노드가 대표적인 예입니다.