PE Notes · 서비스
하이브리드 검색
키워드 희소 검색과 임베딩 밀집 검색을 한 순위로 합치는 하이브리드 검색을 BM25·벡터·RRF·재순위로 가르고, RAG 검색 칸에 올립니다.
단어가 맞으면 찾고, 뜻이 가까우면 찾습니다. 한쪽만 쓰면 빈칸이 남습니다. 은 키워드 희소 검색과 의미 밀집 검색을 같은 질의에 돌린 뒤, 순위를 한 줄로 합칩니다. 사내 검색과 의 검색 칸이 이 손을 씁니다.
희소, 밀집, 둘을 같이
희소는 역색인과 단어 가중입니다. 와 TF-IDF가 대표입니다. 고유명사, 오류 코드, 조문 번호처럼 글자가 같아야 하는 질의에 강합니다. “스마트폰”은 찾지만 “휴대전화”는 놓칩니다.
밀집은 질의를 으로 바꾸고, 에서 를 봅니다. 동의어와 문맥은 열리고, 모델명·약어의 정확 일치는 약합니다. ANN이 근사를 받아 속도를 지킵니다.
| 비교축 | 희소 (BM25) | 밀집 (벡터) | 하이브리드 |
|---|---|---|---|
| 손 | 키워드·역색인 | 임베딩 유사도 | 두 순위 융합 |
| 강점 | 정확 용어 | 동의어·맥락 | 서로 빈칸을 메움 |
| 약점 | 뜻 확장 불가 | 정확 문자열 | 가중·운영 비용 |
| 구현 | Lucene·OpenSearch | FAISS·Pinecone | Weaviate·Qdrant 등 |
순위를 한 줄로
질의는 두 길로 갑니다. BM25가 Top-K1, 벡터가 Top-K2를 냅니다. 점수를 붙이는 손이 셋입니다. 는 각 목록 순위 r의 1/(k+r)을 더합니다. 스케일이 달라도 합치기 쉬워 현장이 자주 고릅니다. 선형 결합은 α×밀집 + (1−α)×희소입니다. α는 도메인마다 다릅니다. 위 후보만 (교차 부호기)로 다시 줄이면, 생성 모델에 넣을 조각이 정밀해집니다.
| 융합 | 한 줄 |
|---|---|
| RRF | 순위 역수 합. 점수 정규화가 거의 필요 없다 |
| 선형 | 가중 합. α 튜닝이 일이다 |
| 재순위 | 상위만 교차 부호기로 다시 줄인다 |
RAG에서 생성이 빗나가는 첫 칸은 검색입니다. 법률·장애 티켓·부품 번호는 희소가 살리고, 같은 뜻의 다른 문장은 밀집이 살립니다. 임베딩이 벡터 쪽을 받치고, 유사도 지표 노트가 거리 식을 이어 받습니다. 통합 프레임워크는 두 검색과 재순위를 한 파이프에 묶습니다.
답안은 희소·밀집 대비, RRF, 파이프, RAG 검색 칸을 한 장에 닫습니다.
기술사 답안 포인트
기출 이력
제140회 정보관리기술사 1교시
관련 용어
관련 토픽
AI
RAG, RIG, MCP, MoE — LLM 최적화 기법
검색으로 지식을 붙이고, 생성 중 근거를 확인하고, 도구를 표준으로 연결하고, 필요한 전문가만 깨우는 네 가지 LLM 최적화 축을 구분합니다.
AI
유사도 — 자카드, 코사인, 실루엣계수
집합 겹침을 보는 자카드, 벡터 방향만 보는 코사인, 군집 응집·분리를 보는 실루엣계수를 입력 유형과 활용으로 구분합니다.
AI
오토인코더·VAE, NER, 임베딩, 트랜스포머
재구성과 생성으로 갈리는 오토인코더와 VAE, 개체명 인식, 정적·문맥 임베딩, Self-Attention 트랜스포머, 그리고 서빙 체감인 TTFT·TPOT을 한 장에서 잇습니다.