PE Notes · 확률통계
표본추출
모집단에서 대표 표본을 고르는 확률·비확률 추출을 가르고, 층화·군집, 표본 크기 식, 선택·무응답 편향을 정리합니다.
모집단 전부를 잴 수 없으면, 고르는 방법이 추론의 품질이 됩니다. 은 에서 분석할 일부를 뽑는 절차입니다. 대표성이 깨지면 점추정·구간·검정 전부가 한쪽으로 깁니다. 학습 데이터를 나누는 손도 같은 칸입니다.
확률과 비확률
확률추출은 각 단위에 알려진 뽑힐 확률을 줍니다. 단순 무작위는 같은 확률입니다. 계통은 시작을 무작위로 두고 k번째마다 집습니다. 는 층을 나눈 뒤 각 층에서 뽑아 소수 층이 빠지지 않게 합니다. 은 군집을 먼저 뽑고 그 안을 전수 또는 다시 뽑습니다. 현장 비용은 줄고 설계효과는 커질 수 있습니다. 다단계는 층을 여러 번 겹칩니다.
비확률은 편의(가까운 대상), 판단(전문가 손), 할당(비율만 맞추고 안은 임의), 눈덩이(소개로 확장)입니다. 희귀 집단 탐색에는 쓰이지만 표준오차를 공식으로 닫기 어렵습니다.
| 방법 | 한 줄 | 주의 |
|---|---|---|
| 단순 무작위 | 동일 확률 | 목록이 필요 |
| 층화 | 층마다 추출 | 소수 보장 |
| 군집 | 묶음 먼저 | 군집 내 닮음 |
| 편의·할당 | 쉽고 빠름 | 확률 아님 |
크기와 편향
모평균을 95%에서 허용오차 E로 보려면 n ≈ (1.96 σ / E)²입니다. 모비율은 n ≈ 1.96² p(1−p) / E²이고, p를 모르면 0.5가 가장 큽니다. E를 줄이면 n이 제곱으로 늘고 비용이 같이 오릅니다.
은 여러 얼굴입니다. 은 특정 층이 과대·과소입니다. 무응답은 안 답한 층이 다릅니다. 생존자 편향은 남은 것만 봅니다. 시간 편향은 한 구간의 스냅샷입니다.
학습에서는 무작위 분할이 기본이고, 클래스 불균형이면 층화 분할이 맞습니다. 교차검증은 같은 표본을 접어 씁니다. 소수 클래스를 늘리거나 다수를 줄이는 재추출은 분포를 바꾸므로 검증은 원래 비율로 둡니다. 답안은 확률 다섯, 비확률 넷, n 식, 편향 네 이름을 한 장에 닫습니다.
기술사 답안 포인트
기출 이력
제140회 정보관리기술사 4교시