PE Notes · 확률통계
베이즈 정리
사전·우도·증거로 사후를 갱신하는 베이즈 정리를 공식과 검진 숫자로 풀고, 나이브 베이즈와 빈도주의 추론을 가릅니다.
증거가 오기 전의 믿음과, 증거가 가리키는 방향은 다른 칸입니다. 는 과 를 곱한 뒤 증거로 나눠 을 얻습니다. 불완전 정보에서 관측이 들어올 때마다 믿음을 고칩니다.
P(A|B) = P(B|A) · P(A) / P(B)
사후 = 우도 × 사전 / 증거입니다.
네 칸과 결합
교집합을 두 방향으로 쪼개면 식이 나옵니다. P(A∩B) = P(A|B)P(B) = P(B|A)P(A). 분모 P(B)는 전확률입니다. A가 참일 때와 거짓일 때를 더합니다. P(B) = P(B|A)P(A) + P(B|Aᶜ)P(Aᶜ).
| 요소 | 기호 | 의미 |
|---|---|---|
| 사전 | P(A) | 증거 전 가설 |
| 우도 | P(B|A) | 가설이 참일 때 데이터 |
| 증거 | P(B) | 데이터가 나올 전체 |
| 사후 | P(A|B) | 증거 후 가설 |
유병률 2%, 민감도 95%, 위양성률 8%인 검진을 둡니다. 양성 확률은 0.95×0.02 + 0.08×0.98 = 0.0974입니다. 양성일 때 실제 유병 사후는 0.019 / 0.0974 ≈ 19.5%입니다. 양성이어도 대다수는 위양성입니다. 희귀 사건에서 사전을 빼먹으면 검진을 과신합니다.
나이브 베이즈와 두 학파
는 특성들이 클래스 아래 조건부 독립이라고 가정합니다. P(클래스|특성) ∝ P(클래스) · Π P(특성ᵢ|클래스). 가정이 거칠어도 스팸·문서 분류에서 빠르고 잘 돕니다. 특성 곱이 0이 되지 않게 스무딩을 붙입니다. 이진 출력의 는 같은 우도 칸입니다.
베이지안은 확률을 믿음의 정도로 보고 모수에 분포를 둡니다. 빈도주의는 확률을 장기 빈도로 보고 모수를 고정값으로 둡니다. 앞은 사후를 갱신하고, 뒤는 검정과 신뢰구간으로 갑니다. 하이퍼파라미터 탐색의 베이지안 최적화, 가중치를 분포로 두는 신경망이 같은 갱신 감각입니다.
| 비교축 | 베이지안 | 빈도주의 |
|---|---|---|
| 확률 | 믿음 | 장기 빈도 |
| 모수 | 분포 | 고정값 |
| 추론 | 사후 갱신 | 검정·구간 |
답안은 공식, 네 이름, 전확률, 희귀 사건의 숫자, 나이브 가정, 두 학파 표를 한 장에 닫습니다.