← 개념서모바일 버전

빅데이터분석기사 개념서

선사부터 현대까지 시대별 7장. 세로 스크롤과 큰 글씨로 정리한 모바일 읽기 최적 버전입니다.

빅데이터분석기사 — 과목별 개념서

27
1
빅데이터 개요와 활용

데이터와 정보의 구분, 빅데이터의 3V와 확장, 데이터 사이언스와 분석 조직, DIKW 피라미드를 다룹니다.

2
빅데이터 기술과 제도

빅데이터 플랫폼 계층과 하둡 에코시스템, 분산 컴퓨팅 기술, 개인정보보호 법·제도와 데이터 3법, 가명정보와 마이데이터를 다룹니다.

3
분석 방안 수립

분석 기획의 4분면, KDD·CRISP-DM·빅데이터 분석 방법론, 하향식·상향식 문제 접근, 분석 과제 정의와 우선순위 매트릭스, 마스터플랜과 분석 성숙도를 다룹니다.

4
분석 작업 계획

데이터 확보 계획과 WBS 작성, 분석 작업 계획서, 분석 프로젝트의 5대 관리 영역, 프로젝트 관리 10개 지식영역과 5개 프로세스 그룹을 다룹니다.

5
데이터 수집과 전환

데이터 수집 절차와 유형별 수집 기술(ETL·FTP·Open API·Sqoop·Flume·Kafka·CEP·크롤링), 데이터 변환 기법, 개인정보 비식별화 5기법과 프라이버시 보호 모델, 데이터 품질 검증을 다룹니다.

6
데이터 적재와 저장

DW·DM·ODS와 데이터 레이크, HDFS와 분산 파일 시스템, NoSQL 4유형과 CAP 정리, 저장 시스템 구성(DAS·NAS·SAN)을 다룹니다.

1
데이터 정제

결측값의 세 유형(MCAR·MAR·MNAR)과 대치 방법, 이상값 탐지 기법과 처리 전략을 다룹니다.

2
분석 변수 처리

변수 선택(필터·래퍼·임베디드), 차원축소(PCA·LDA·SVD·MDS·요인분석), 파생변수와 변수 변환, 불균형 데이터 처리를 다룹니다.

3
데이터 탐색 기초

EDA의 4가지 주제, 개별·다차원 데이터 탐색 방법, 상관분석(피어슨·스피어만·켄달)과 기초통계량을 다룹니다.

4
고급 데이터 탐색

시공간 데이터, 다변량 데이터, 비정형 데이터의 특성과 각각에 맞는 탐색·시각화 기법을 다룹니다.

5
기술통계와 확률분포

중심경향치·산포도·왜도·첨도, 이산·연속 확률분포, 표본분포와 중심극한정리, 표본추출 방법을 다룹니다.

6
추론통계 · 추정과 가설검정

점추정과 구간추정(신뢰구간), 가설검정 절차와 1종·2종 오류, 검정력과 p-value, 모수·비모수 검정의 구분을 다룹니다.

1
분석 절차 수립

분석 모형 설계 4단계 절차, 모형 선정 기준, 지도·비지도·강화학습의 구분, 훈련·검증·평가 데이터 분할과 교차 검증을 다룹니다.

2
분석 환경 구축

분석 도구(R·Python·SAS·SPSS) 비교, 하둡 생태계와 분산 처리 환경, 데이터 저장 구조와 분석 데이터 분할 전략을 다룹니다.

3
회귀분석

단순·다중 회귀와 최소제곱법, 회귀분석의 5가지 가정, 결정계수와 수정결정계수, 다중공선성과 VIF, 변수 선택, 정규화 회귀(Ridge·Lasso·Elastic Net), 로지스틱 회귀와 오즈비를 다룹니다.

4
분류분석

의사결정나무의 분리 기준(지니지수·엔트로피·카이제곱)과 가지치기, CART·C4.5·CHAID 비교, KNN, 나이브베이즈, SVM의 초평면·마진·커널을 다룹니다.

5
군집분석

계층적 군집의 연결법과 덴드로그램, K-평균 군집의 절차와 단점, 엘보우·실루엣으로 K 결정, DBSCAN, 혼합분포군집(EM), SOM을 다룹니다.

6
연관성 분석

지지도·신뢰도·향상도의 정의와 계산, 향상도 해석 방향, Apriori 알고리즘과 FP-Growth, 연관분석의 장단점을 다룹니다.

7
앙상블 분석

앙상블의 원리, 배깅과 부스팅의 차이, 랜덤포레스트와 OOB, AdaBoost·GBM·XGBoost, 보팅과 스태킹을 다룹니다.

8
인공신경망과 딥러닝

퍼셉트론과 XOR 문제, 활성화 함수, 역전파와 기울기 소실, CNN의 합성곱·패딩·스트라이드·풀링과 출력 크기 계산, RNN·LSTM을 다룹니다.

9
고급 분석기법 · 시계열·베이지안·비모수

시계열의 정상성과 ARIMA, 베이지안 추론, 비모수 검정, 다차원척도법, 생존분석을 다룹니다.

10
비정형 데이터 분석 · 텍스트마이닝·SNA

텍스트마이닝 전처리와 TDM·TF-IDF 계산, 토픽모델링과 감성분석, 사회연결망분석의 중심성 지표를 다룹니다.

1
분석모형 평가

혼동행렬 지표 계산, ROC·AUC와 향상도 곡선, 회귀·군집 평가지표, 교차검증 기법을 다룹니다.

2
분석모형 개선

과대·과소적합과 편향-분산 트레이드오프, 규제 기법, 초매개변수 최적화, 모형 융합과 최종 모형 선정을 다룹니다.

3
분석결과 해석

분석 모형 해석(변수 중요도·부분의존도), 해석 시 오류, 비즈니스 기여도 평가(ROI·TCO·NPV·IRR)를 다룹니다.

4
분석결과 시각화

시간·분포·관계·비교·공간 시각화의 유형 분류, 인포그래픽, 시각화 설계 3단계 절차를 다룹니다.

5
분석결과 활용

분석 모형 전개와 운영 적용, 성능 모니터링과 리모델링 주기, 분석 보고서 구성, 시각화 도구를 다룹니다.