PE Notes · AI
의사결정나무
루트에서 리프까지 if-then으로 가르는 의사결정나무의 불순도 기준, CART 절차, 가지치기와 랜덤포레스트·부스팅으로의 확장을 비교합니다.
표 데이터를 사람이 읽을 수 있는 규칙으로 나누고 싶을 때 먼저 꺼내는 모형이 입니다. 루트에서 특성을 고르고, 내부 노드마다 집합을 가르며, 리프에 클래스나 숫자를 둡니다. 정규화가 거의 필요 없고 시각화가 쉬워, 설명가능 요구가 있는 심사·진단에 자주 붙습니다.
노드와 분기 기준
나무는 세 가지 자리만 기억하면 됩니다. 루트는 첫 분할, 내부는 조건, 리프는 예측입니다. 분할 품질은 불순도가 얼마나 떨어지는지로 봅니다.
| 자리 | 역할 |
|---|---|
| 루트 노드 | 전체 자료를 처음 나누는 특성. |
| 내부 노드 | 특성·임계값으로 자식 집합을 만든다. |
| 리프 노드 | 더 나누지 않고 클래스 또는 수치를 반환한다. |
| 분기 기준 | 어떤 특성·임계가 불순도를 가장 낮추는지. |
| 과적합을 막기 위해 가지를 미리 또는 나중에 자른다. |
| 비교축 | (정보이득) | MSE (회귀) | |
|---|---|---|---|
| 식 | (1-\sum p_i^{2}) | (-\sum p_i\log_2 p_i) | (\sum(y_i-\bar y)^{2}/n) |
| 과업 | 분류 | 분류 | 회귀 |
| 비용 | 제곱이라 싸다 | 로그라 더 비싸다 | 싸다 |
| 보는 것 | 클래스 편중 | 정보량·순수성 | 분기 후 분산 감소 |
| 알고리즘 | ID3, C4.5 | CART |
CART는 보통 이진 분기이고 분류·회귀를 같이 합니다. ID3는 범주형과 정보이득, C4.5는 이득비와 연속형·가지치기까지 넣습니다.
학습 절차와 과적합
CART 한 스텝은 모든 특성·임계를 시험해 자식 불순도의 가중합이 가장 작은 분할을 고르고, 자식에 같은 일을 재귀합니다. 최대 깊이, 최소 표본, 불순도 하한에 닿으면 리프가 됩니다.
| 막는 법 | 언제 자르나 |
|---|---|
| 사전 가지치기 | 깊이·최소 샘플을 미리 막아 크게 키우지 않는다. |
| 사후 가지치기 | 다 키운 뒤 일반화에 도움이 안 되는 가지를 없앤다. |
| 교차검증 | 어떤 깊이와 가지가 검증 점수를 지키는지 고른다. |
한 그루는 학습 표본이 조금만 바뀌어도 최상단 분할이 달라질 수 있습니다. 그 분산을 낮추려고 여러 나무를 묶습니다. 는 배깅과 특성 무작위 추출로 투표하고, 그래디언트 부스팅(XGBoost, LightGBM)은 잔차를 다음 나무가 받아 편향을 줄입니다. 스태킹은 나무 출력을 메타 학습기가 다시 봅니다.
장단점과 쓰는 자리
해석력과 전처리 부담이 장점이고, 깊은 나무의 암기와 축 평행 경계가 단점입니다.
| 축 | 강점 | 약점 |
|---|---|---|
| 해석 | if-then을 그려 설명할 수 있다 | 가지가 많으면 계단식 경계로 과잉 표현된다 |
| 데이터 | 수치·범주 혼합, 스케일링 불필요 | 표본 변화에 구조가 크게 흔들린다 |
| 예측 | 리프까지 내려가는 속도가 빠르다 | 과적합에 약하다. 가지치기·앙상블이 전제다 |
의료 증상에서 질환을 가르거나, 대출 위험을 규칙으로 남기거나, 로그 패턴을 이상으로 표시할 때 나무가 먼저 갑니다. 신뢰성 관점에서는 설명가능성은 높고, 불안정·과적합은 공정성과 재현 점수를 흔들 수 있어 교차검증과 앙상블을 같이 적습니다.
기술사 답안 포인트
관련 용어
관련 토픽
AI
데이터마이닝 — K-means, DBSCAN, SVM, LSTM·GRU
비지도 군집(K-means·DBSCAN)과 지도 분류·순차모델(SVM·LSTM·GRU)을 같은 장에서 나누고, 과업과 데이터 형에 맞춰 고르는 기준을 정리합니다.
AI
머신러닝 파이프라인과 지도·비지도학습
수집부터 재학습까지를 한 흐름으로 묶는 ML 파이프라인과, 레이블 유무로 갈리는 지도·비지도·준지도·자기지도학습을 비교합니다.
AI
모델 평가와 신뢰성 AI
분류·회귀·생성·군집·검증으로 나눈 평가 지표와, 안전성·공정성·설명가능성 등 신뢰성 AI의 핵심 속성을 한 장에서 연결합니다.