← 개념서태블릿/PC 버전
2과목 · 빅데이터 탐색·5

기술통계와 확률분포

중심경향치·산포도·왜도·첨도, 이산·연속 확률분포, 표본분포와 중심극한정리, 표본추출 방법을 다룹니다.

모집단과 표본

구분 대상 요약값 표기
모집단(Population) 알고 싶은 전체 집단 모수(Parameter) — 고정된 상수 모평균 뮤, 모분산 시그마 제곱
표본(Sample) 모집단에서 뽑은 일부 통계량(Statistic) — 표본마다 달라지는 확률변수 표본평균 엑스바, 표본분산 s 제곱

기술통계는 가진 데이터를 요약·묘사하는 것이고, 추론통계는 표본으로 모수를 추정·검정하는 것입니다.

측정 척도

척도 성질 가능한 연산
명목척도 구분만 성별, 혈액형 빈도, 최빈값
순서척도 순위 있음, 간격 무의미 학점, 만족도 + 중앙값, 순위상관
구간(등간)척도 간격 일정, 절대 0 없음 온도(섭씨), 지능지수 + 평균, 표준편차
비율척도 절대 0 존재, 비율 비교 가능 키, 무게, 소득 + 비율·기하평균

섭씨 온도가 등간척도인 이유는 0도가 "온도가 없음"을 뜻하지 않아 "20도는 10도의 2배"라고 말할 수 없기 때문입니다. 이 예가 그대로 출제됩니다.

중심경향치

통계량 특징
산술평균 모든 값을 반영하지만 이상값에 민감
기하평균 값들의 곱의 n제곱근 — 비율·성장률의 평균
조화평균 역수의 평균의 역수 — 속도 같은 비율의 평균
중앙값 순서상 가운데 값 — 이상값에 강건
최빈값 가장 자주 나오는 값 — 명목척도에서도 사용 가능

세 평균의 크기 관계는 항상 산술평균 ≥ 기하평균 ≥ 조화평균 입니다.

산포도

통계량 내용
범위 최댓값 − 최솟값
사분위범위(IQR) Q3 − Q1
분산 편차 제곱의 평균. 표본분산은 n − 1로 나눔(불편추정)
표준편차 분산의 제곱근 — 원래 단위로 돌아옴
변동계수(CV) 표준편차 ÷ 평균 — 단위가 다른 집단 간 산포 비교

표본분산에서 n이 아니라 n − 1로 나누는 이유는 그렇게 해야 모분산의 불편추정량이 되기 때문입니다. n으로 나누면 모분산을 과소추정합니다.

왜도와 첨도

왜도 꼬리 세 대표값 순서
왜도 > 0 (양의 왜도, 오른쪽 꼬리) 오른쪽으로 길게 최빈값 < 중앙값 < 평균
왜도 = 0 좌우 대칭 최빈값 = 중앙값 = 평균
왜도 < 0 (음의 왜도, 왼쪽 꼬리) 왼쪽으로 길게 평균 < 중앙값 < 최빈값

첨도는 분포가 얼마나 뾰족한가입니다. 정규분포의 첨도는 3이고, 3을 빼서 정의한 초과첨도는 정규분포에서 0입니다. 첨도가 3보다 크면 봉우리가 뾰족하고 꼬리가 두껍습니다.

양의 왜도에서 평균이 가장 오른쪽(가장 큼) 이라는 것만 기억하면 순서가 풀립니다. 소득 분포가 대표적인 양의 왜도입니다. 첨도 기준을 0과 3 중 무엇으로 쓰는지 문제 문장을 꼭 확인하세요.

표본추출 방법

방법 내용
단순 무작위 추출 모든 개체가 뽑힐 확률이 같음
계통(체계적) 추출 첫 번째만 무작위로 고르고 이후 일정 간격 K = N ÷ n으로 뽑음
층화 추출 모집단을 층 내부는 동질적, 층 간에는 이질적으로 나눈 뒤 각 층에서 무작위 추출
군집(집락) 추출 모집단을 군집 간에는 동질적, 군집 내부는 이질적으로 나눈 뒤 군집 단위로 뽑아 그 안을 전수 조사

편의추출·판단추출·눈덩이추출은 비확률 표본추출로, 표본오차를 계산할 수 없습니다.

층화 vs 군집이 단골입니다. 층화는 층마다 뽑고(층 내 동질), 군집은 군집 자체를 뽑습니다(군집 간 동질). 성별·연령대로 나눠 각 집단에서 뽑으면 층화, 학교 몇 곳을 골라 그 학교 학생 전부를 조사하면 군집입니다.

이산확률분포

분포 상황 기댓값 분산
베르누이 성공/실패 1회 시행 p p(1 − p)
이항 B(n, p) 독립 시행 n회의 성공 횟수 np np(1 − p)
포아송 단위 시간·공간에서 사건 발생 횟수 람다 람다 (평균 = 분산)
기하 첫 성공이 나올 때까지의 시행 횟수 1 ÷ p (1 − p) ÷ p 제곱
초기하 비복원 추출에서의 성공 횟수

계산 예: n = 100, p = 0.2인 이항분포라면 평균 = 100 × 0.2 = 20, 분산 = 100 × 0.2 × 0.8 = 16, 표준편차 = 4 입니다.

포아송은 평균과 분산이 같다(둘 다 람다) 는 것이 매번 나옵니다. 그리고 이항분포에서 n이 크고 p가 아주 작으면 포아송분포로 근사합니다. 기하분포는 첫 성공까지의 횟수이고, 성공 r번까지면 음이항분포입니다.

연속확률분포

분포 쓰임 특징
정규분포 가장 기본 종 모양 대칭, 평균 = 중앙값 = 최빈값, 왜도 0
표준정규분포 Z 표준화 Z = (X − 뮤) ÷ 시그마, 평균 0 · 분산 1
t분포 모분산을 모를 때 모평균 추론 자유도 n − 1, 정규분포보다 꼬리가 두껍고 봉우리가 낮음. 자유도가 커지면 표준정규에 수렴
카이제곱분포 분산 검정, 적합도·독립성 검정 값이 0 이상, 오른쪽 꼬리가 긴 비대칭. 자유도 하나
F분포 두 집단 분산비 검정, 분산분석(ANOVA) 두 카이제곱의 비, 자유도 두 개, 0 이상 비대칭
지수분포 사건 사이의 대기 시간 포아송과 짝을 이룸

정규분포에서 평균 ± 1시그마 안에 약 68%, ± 2시그마에 약 95%, ± 3시그마에 약 **99.7%**가 들어옵니다.

t분포의 자유도는 n − 1입니다. n으로 적어 놓은 선택지가 오답입니다. 그리고 t분포는 정규분포보다 퍼져 있어 같은 신뢰수준에서 구간이 더 넓어집니다. 독립성 검정의 카이제곱 자유도는 (행 − 1) × (열 − 1)입니다.

표본분포와 중심극한정리

표본평균의 분포에서

  • 기댓값 = 모평균 (표본평균은 모평균의 불편추정량)
  • 표준편차 = 표준오차 = 시그마 ÷ 루트 n

예: 모표준편차가 20이고 표본 크기가 100이면 표준오차는 20 ÷ 10 = 2 입니다. 표본 크기를 4배로 늘리면 표준오차는 절반이 됩니다.

중심극한정리(CLT): 모집단의 분포가 무엇이든, 표본 크기 n이 충분히 크면(보통 30 이상) 표본평균의 분포는 정규분포에 근사합니다.

표준편차와 표준오차를 섞어 묻습니다. 표준편차는 개별 관측치의 흩어짐, 표준오차는 표본평균의 흩어짐입니다. 표본이 커져도 모표준편차는 그대로지만 표준오차는 작아집니다. 또 CLT는 "모집단이 정규분포여야 한다"는 조건이 필요 없습니다 — 그 서술이 오답입니다.