PE Notes · AI
유사도 — 자카드, 코사인, 실루엣계수
집합 겹침을 보는 자카드, 벡터 방향만 보는 코사인, 군집 응집·분리를 보는 실루엣계수를 입력 유형과 활용으로 구분합니다.
“가깝다”는 말은 데이터가 집합인지, 벡터인지, 이미 나뉜 군집인지에 따라 수식이 달라집니다. 추천·검색·가 한 문항에 나오면, 측정 대상을 먼저 고르고 공식을 적습니다.
자카드 유사도
는 두 집합의 교집합 크기를 합집합 크기로 나눕니다.
J(A, B) = |A ∩ B| / |A ∪ B|
범위는 0에서 1입니다. 0은 겹침이 없고, 1은 같은 집합입니다. 항목의 있음/없음만 있을 때, 즉 장바구니·태그·이진 벡터에 맞습니다.
예: A = {사과, 바나나, 오렌지}, B = {바나나, 오렌지, 포도}이면 교집합 2, 합집합 4이므로 J = 0.5입니다. 각 과일의 “양”은 보지 않습니다.
코사인 유사도
는 두 벡터가 이루는 각의 코사인입니다. 길이(크기)는 버리고 방향만 남깁니다.
cos(θ) = (A · B) / (|A| × |B|)
범위는 −1에서 1입니다. 1은 같은 방향, 0은 직교, −1은 반대입니다. TF-IDF나 처럼 차원이 크고 문서 길이만 다른 비교에 강합니다. 검색, 추천의 사용자·아이템 벡터가 대표 사용처입니다.
실루엣계수
는 군집 결과를 평가합니다. 점 i에 대해 같은 군집 안 평균 거리 a(i)와, 가장 가까운 다른 군집까지 평균 거리 b(i)를 비교합니다.
s(i) = (b(i) − a(i)) / max(a(i), b(i))
a가 작고 b가 클수록 1에 가깝습니다. 0 근처는 경계, 음수는 잘못된 군집입니다.
비교와 선택
| 비교축 | 자카드 | 코사인 | 실루엣계수 |
|---|---|---|---|
| 측정 대상 | 집합 간 유사 | 벡터 방향 유사 | 군집 결과 품질 |
| 입력 | 이진·집합 | 연속 벡터 | 군집 레이블 + 거리 |
| 크기(magnitude) | 해당 없음 | 반영하지 않음 | 거리로 반영 |
| 범위 | 0 ~ 1 | −1 ~ 1 | −1 ~ 1 |
| 대표 활용 | 장바구니, 태그, 공통 관심 | 문서·임베딩 검색 | 최적 군집 수 k |
집합이면 자카드, 벡터에서 방향만 보면 코사인, 크기까지 보면 유클리드를 고릅니다. 이미 나눈 군집의 품질이면 실루엣입니다.
실루엣으로 k 고르기
K-means는 k를 사람이 줍니다. k = 2, 3, …를 돌려 평균 실루엣을 비교하고, 가장 큰 값을 후보로 둡니다. 대략 0.7 이상은 구조가 분명하고, 0.25 이하는 군집이라고 보기 어렵습니다.
엘보우(관성 감소)는 그림으로 보기 쉽고 계산이 싸지만, “팔꿈치”를 사람이 읽습니다. 답안에는 두 방법을 비교축(응집+분리 vs 관성, 수치의 명확성, 비용)으로 적습니다.
기술사 답안 포인트
관련 용어
관련 토픽
AI
RAG, RIG, MCP, MoE — LLM 최적화 기법
검색으로 지식을 붙이고, 생성 중 근거를 확인하고, 도구를 표준으로 연결하고, 필요한 전문가만 깨우는 네 가지 LLM 최적화 축을 구분합니다.
AI
데이터마이닝 — K-means, DBSCAN, SVM, LSTM·GRU
비지도 군집(K-means·DBSCAN)과 지도 분류·순차모델(SVM·LSTM·GRU)을 같은 장에서 나누고, 과업과 데이터 형에 맞춰 고르는 기준을 정리합니다.
AI
편향, 과적합 해결, 최적화 알고리즘, 차원축소
공정성 관점의 편향 유형, 과적합을 데이터·모델·학습 단계에서 줄이는 기법, GD에서 Adam까지의 옵티마이저, 선형·비선형 차원축소를 구분합니다.