PE Notes · DB
앙상블 모형
약한 학습기를 모아 오차를 상쇄하는 앙상블을 배깅과 부스팅으로 가르고, 랜덤 포레스트·그래디언트 부스팅·스태킹과 편향·분산 자리를 정리합니다.
한 그루가 학습 표를 외우면 시험 표에서 흔들립니다. 은 약한 학습기를 여럿 두고, 서로 다른 실수가 상쇄되게 묶습니다. 분류·회귀에서 단일 모형보다 자주 윗자리를 차지하는 이유입니다.
나란히 묶을 것인가, 이어서 고칠 것인가
은 복원 추출로 표본을 여러 장 만들고, 각 장에서 독립으로 학습합니다. 분류는 다수결, 회귀는 평균입니다. 목표가 분산을 낮추는 쪽입니다. 트리가 흔들려도 투표가 평균을 잡아 줍니다. 은 줄고, 이상치 한 점에 전체가 기울지 않습니다.
은 앞 모형이 틀린 표본에 무게를 싣고 다음을 학습합니다. 순차라 병렬이 어렵고, 편향을 깎는 대신 잡음에도 예민합니다. AdaBoost는 오분류 가중치를 올리고, 그래디언트 부스팅은 잔차를 다음 트리가 따라갑니다.
| 비교축 | 배깅 | 부스팅 |
|---|---|---|
| 학습 | 병렬·독립 | 순차·의존 |
| 줄이는 것 | 분산 | 편향 |
| 표본 | 부트스트랩 | 가중·잔차 |
| 결합 | 평균·다수결 | 가중 합 |
| 이상치 | 둔감 | 민감 |
| 대표 | 랜덤 포레스트 | AdaBoost·XGBoost |
자리에서 둘은 보완입니다. 배깅은 복잡한 기본기를 안정화하고, 부스팅은 단순한 기본기를 깊게 만듭니다.
숲, 잔차, 메타 모형
는 배깅에 특성 무작위까지 넣습니다. 각 가 다른 열을 보게 해 상관을 끊습니다. 특성 중요도를 얻기 쉽고, 해석은 한 그루보다 흐립니다.
그래디언트 부스팅은 잔차 위에 트리를 쌓고, L1·L2 로 과적합을 눌러 둡니다. 결측을 기본기가 흡수하는 구현이 많고, 표 데이터 대회에서 자주 윗줄입니다. LightGBM은 잎 우선 성장으로 같은 계열을 더 얇게 돌립니다.
은 1층 예측을 입력으로 메타 모형이 다시 고릅니다. 투표는 하드(표)와 소프트(확률 평균)입니다. 블렌딩은 검증 분할만으로 비슷한 일을 합니다.
혼동행렬 노트가 정밀도·재현을 재면, 앙상블은 그 숫자를 올리려 오차를 나눕니다. 연관규칙()이 장바구니 패턴을 찾으면, 이쪽은 예측기를 묶습니다. 군집·SVM·시계열 기본기는 데이터마이닝 노트에 두고, 여기서는 묶는 방식만 닫습니다.
답안은 배깅·부스팅 표, 포레스트와 그래디언트 부스팅 한 줄, 스태킹, 편향·분산 자리를 한 장에 올립니다.
기술사 답안 포인트
관련 용어
관련 토픽
AI
데이터마이닝 — K-means, DBSCAN, SVM, LSTM·GRU
비지도 군집(K-means·DBSCAN)과 지도 분류·순차모델(SVM·LSTM·GRU)을 같은 장에서 나누고, 과업과 데이터 형에 맞춰 고르는 기준을 정리합니다.
확률통계
혼동행렬 계산과 해석
실제와 예측을 네 칸에 놓고 정확도·정밀도·재현율·F1을 숫자로 계산하고, 임계값과 도메인 비용으로 어느 칸을 줄일지 고릅니다.
확률통계
Apriori 기법
빈발 항목집합을 길이 1부터 키우며 가지치는 Apriori를 지지도·신뢰도·향상도와 같이 정리하고, 후보 폭증과 FP-Growth를 가릅니다.