PE Notes · AI
데이터마이닝 — K-means, DBSCAN, SVM, LSTM·GRU
비지도 군집(K-means·DBSCAN)과 지도 분류·순차모델(SVM·LSTM·GRU)을 같은 장에서 나누고, 과업과 데이터 형에 맞춰 고르는 기준을 정리합니다.
데이터마이닝 문항은 알고리즘을 나열하기보다 레이블이 있는지, 군집 형태가 어떤지, 입력이 벡터인지 시퀀스인지를 먼저 가릅니다. 이 글은 비지도 쪽의 ·과, 지도 쪽의 ··를 한 세트로 둡니다.
정의
K-means는 점을 K개 중심에 나눠 담는 군집화입니다. DBSCAN은 반경 안 밀도로 군집을 키우고, 어디에 못 붙는 점은 노이즈로 남깁니다. 둘 다 정답 레이블이 없는 비지도입니다.
SVM은 두 클래스를 가르는 마진이 최대인 초평면을 찾습니다. LSTM과 GRU는 시계열·문장처럼 순서가 있는 입력을 다루는 게이트 순환망입니다. 레이블이 있는 분류·예측에 씁니다.
등장 배경 / 필요성
거리만으로 묶으면 구형 덩어리는 잘 나오지만, 초승달처럼 휘어진 군집과 이상치는 중심에 강제로 끌려갑니다. 밀도 기반이 그 빈칸을 메웁니다.
선형 분류기는 겹친 클래스를 못 가릅니다. 고차원으로 올리되 좌표를 직접 만들지 않는 커널이 필요했습니다. 순환망은 기본 RNN이 긴 의존에서 에 막히면서, 무엇을 기억하고 버릴지를 게이트로 고르게 되었습니다.
K-means와 DBSCAN
K-means는 (1) K개 중심을 두고, (2) 각 점을 가장 가까운 중심에 배정하고, (3) 군집 평균으로 중심을 옮기고, (4) 중심이 멈출 때까지 반복합니다. 구현이 단순하고 규모에도 잘 늘어납니다. 값은 미리 정해야 하고, 구형을 가정하며, 이상치와 초기값에 흔들립니다. K는 엘보우·실루엣·Gap으로 보고, 초기화는 K-means++가 흔합니다.
DBSCAN은 ε 반경 안에 MinPts 이상이면 핵심점, 핵심점 옆이지만 자신은 핵심이 아니면 경계점, 어디에도 못 붙으면 노이즈입니다. 맞닿은 핵심점들이 한 군집이 됩니다. K를 미리 정하지 않고, 임의 형태와 이상치 분리에 강합니다. 밀도 차가 크면 한 ε로 못 맞춥니다.
| 비교축 | K-means | DBSCAN |
|---|---|---|
| 군집 수 | 사전 지정 | 결과로 나옴 |
| 형태 | 구형 가정 | 임의 형태 |
| 이상치 | 강제 배정 | 노이즈로 분리 |
| 밀도 차 | 취약 | 취약(균일 밀도에 가깝게 봄) |
| 하이퍼파라미터 | K | ε, MinPts |
SVM과 커널 트릭
SVM은 마진 2 / ‖w‖를 키우는 초평면을 풉니다. 경계에 앉은 점만 서포트 벡터가 되고, 나머지를 버려도 경계는 같습니다. 완전히 못 가르는 데이터에는 슬랙과 C로 오분류를 일부 허용합니다. C가 크면 마진이 줄고 과적합에 가깝습니다.
선형으로 안 갈리면 으로 고차원 내적만 계산합니다. 좌표를 실제로 만들지 않습니다.
| 커널 | 식 | 쓰는 때 |
|---|---|---|
| 선형 | K(x, z) = xᵀz | 이미 선형에 가깝거나 특징이 표본보다 많을 때 |
| 다항식 | (xᵀz + c)^d | 다항 경계 |
| RBF | exp(−γ‖x − z‖²) | 비선형 일반 |
고차원·소규모 표, 텍스트 가방, 유전자 발현처럼 특징이 많은 분류에 잘 맞습니다. 수백만 행에서는 학습이 부담이고, 기본 출력은 확률이 아닙니다.
LSTM과 GRU
기본 RNN은 긴 구간에서 기울기가 사라집니다. LSTM은 망각·입력·출력 세 게이트와 셀 상태로, 장기 기억을 선택해 유지합니다. 망각은 버릴 것, 입력은 새로 넣을 양, 출력은 지금 내보낼 조각입니다.
GRU는 리셋·업데이트 두 게이트와 은닉 상태만 둡니다. 파라미터가 적어 학습이 빠르고, 짧은 시계열·실시간에서 자주 고릅니다. 아주 긴 문맥은 Transformer가 앞서는 구간이 많습니다.
| 비교축 | LSTM | GRU |
|---|---|---|
| 게이트 | 3 (망각·입력·출력) | 2 (리셋·업데이트) |
| 상태 | 셀 + 은닉 | 은닉만 |
| 파라미터·속도 | 많고 느린 편 | 적고 빠른 편 |
| 긴 시퀀스 | 상대적으로 강함 | 짧은 구간에서 유리한 경우가 많음 |
구성도 / 선택
과업이 분류면 SVM이나 트리 계열, 회귀·시계열이면 선형 또는 LSTM, 레이블이 없으면 군집입니다. 표는 앙상블이 강한 편이고, 이미지는 합성곱, 짧은 순서는 LSTM·GRU입니다.
이해(목표·KPI) → 탐색·준비 → 모델 선택·학습 → 평가 → 배포·모니터링
활용 사례
- 고객 세분화, 유사 문서 묶기 — K-means
- 이상 거래·공간 밀집 탐지 — DBSCAN
- 소규모 고차원 분류 — SVM + RBF/선형
- 단기 수요·음성 구간 — LSTM 또는 GRU