PE Notes · 확률통계
Apriori 기법
빈발 항목집합을 길이 1부터 키우며 가지치는 Apriori를 지지도·신뢰도·향상도와 같이 정리하고, 후보 폭증과 FP-Growth를 가릅니다.
같이 담긴 쌍이 우연인지, 진열과 추천의 실마리인지는 한 번의 빈도로 닫히지 않습니다. 는 에서 자주 나타나는 항목집합만 남기고, 그보다 긴 후보는 그 위에서만 키웁니다. 이고 레이블이 없습니다. 통과 기준은 지지도, 신뢰도, 향상도 셋입니다.
세 측도와 가지치기
는 P(X∩Y), 전체 거래 중 둘이 같이 나타난 비율입니다. 희귀 쌍을 먼저 버립니다. 는 P(Y|X), X가 있을 때 Y도 있는 비율입니다. 는 신뢰도를 P(Y)로 나눕니다. 1이면 독립, 그보다 크면 양의 연관, 작으면 음의 연관입니다. 신뢰도가 높아도 Y 자체가 흔하면 향상도는 1에 붙습니다.
원리는 한 줄입니다. {A, B}가 최소 지지도에 못 미치면 {A, B, C}도 못 미칩니다. 그 가지를 잘라 후보 폭증을 막습니다. 반대로, 빈발 집합의 모든 부분집합은 빈발입니다.
| 측도 | 식 | 읽는 법 |
|---|---|---|
| 지지도 | P(X∩Y) | 얼마나 자주 같이 |
| 신뢰도 | P(Y|X) | X일 때 Y |
| 향상도 | Conf / P(Y) | 독립 대비 배수 |
거래 8건에서 커피가 5, 차가 4, 동시가 3이면 지지도는 3/8입니다. 커피→차의 신뢰도는 (3/8)/(5/8)=0.6, 향상도는 0.6/(4/8)=1.2입니다. 최소 지지도 0.3, 최소 신뢰도 0.5를 두면 이 규칙은 남습니다.
절차와 FP-Growth
최소 지지도를 정하고 1-항목의 빈발을 셉니다. 남은 항목만 짝 지어 2-항목을 만들고, 다시 지지도를 재 미달을 버립니다. k-항목이 비면 멈춥니다. 남은 빈발에서 최소 신뢰도·향상도를 넘는 X → Y만 규칙으로 남깁니다. 데이터를 길이마다 다시 읽는 것이 대가입니다.
는 거래를 FP-Tree에 압축한 뒤 후보 집합을 거의 만들지 않습니다. 스캔이 적고 대량에 유리하며, 트리 구현은 더 까다롭습니다. Apriori는 해석과 손계산이 쉽고, 항목이 늘면 조합이 먼저 지칩니다.
| 비교축 | Apriori | FP-Growth |
|---|---|---|
| 탐색 | 길이별 후보 | 트리 압축 |
| 스캔 | 여러 번 | 적음 |
| 약점 | 후보 폭증 | 구현 복잡도 |
규칙은 상관이지 인과가 아닙니다. 시간 순서는 순차 패턴이 따로 봅니다. 임계를 낮추면 규칙이 수천이 되어 운영 가치가 사라집니다. 답안은 세 식, 가지치기 한 줄, 절차, FP-Growth 대비를 한 장에 닫습니다.