PE Notes · AI
PLM, 프롬프트·하네스 엔지니어링, Multimodal LLM
사전학습 언어모델이 어떻게 만들어지고, 프롬프트와 실행 환경(하네스)이 무엇을 나누며, 이미지·음성·텍스트를 한 코어에서 다루는 멀티모달 LLM을 정리합니다.
태스크마다 모델을 처음부터 만들면 라벨과 연산이 매번 다시 듭니다. 은 그 비용을 한 번 크게 배우고, 나중에 얇게 맞추는 쪽으로 바꿉니다. 맞추는 방법은 가중치를 건드리는 이거나, 가중치는 두고 입력만 설계하는 입니다. 에이전트처럼 도구와 루프가 붙으면 프롬프트만으로는 부족하고, 모델을 감싸는 이 필요합니다. 입력이 글이 아니면 으로 양식을 합칩니다.
PLM (Pre-trained Language Model)
PLM은 대규모 코퍼스에서 으로 언어의 통계·의미 패턴을 먼저 익힌 뒤, 다운스트림 과제에 미세조정하거나 프롬프트로 쓰는 언어모델입니다. BERT·GPT 계열이 대표입니다.
사전학습 목적함수로 유형을 나누면 읽기가 쉽습니다.
| 유형 | 대표 | 학습 방식 |
|---|---|---|
| Autoregressive (자기회귀) | GPT 계열 | 이전 토큰으로 다음 토큰을 예측한다. |
| Autoencoding (자동인코딩) | BERT 계열 | 마스킹된 토큰을 복원한다(MLM). |
| Encoder-Decoder | T5, BART | 입력 시퀀스를 출력 시퀀스로 변환한다. |
흐름은 대규모 원시 텍스트 → 사전학습(자기지도) → PLM → 미세조정 또는 프롬프팅 → 과제 적용입니다. 이후 초거대 LLM, 경량 , 멀티모달로 가지가 갈라집니다.
프롬프트 엔지니어링 vs 하네스 엔지니어링
프롬프트 엔지니어링은 파라미터를 바꾸지 않고 지시문, 역할, 소수 예시, 같은 입력을 설계해 출력을 유도합니다. 단발 QA·요약에는 이 층만으로 충분한 경우가 많습니다.
하네스 엔지니어링은 그 바깥입니다. 도구 호출, 재시도·가드레일, 기억·상태, 반복 조율처럼 모델을 둘러싼 실행 환경을 설계합니다. 다단계 과제와 에이전트는 여기가 없으면 한 번의 잘못된 생성이 워크플로 전체로 번집니다. 로 도구를 표준 연결하는 구성도 이 층에 가깝습니다.
| 비교축 | 프롬프트 엔지니어링 | 하네스 엔지니어링 |
|---|---|---|
| 대상 | 한 번의 입력 텍스트 | 모델을 감싼 실행 시스템 |
| 범위 | 지시문·예시·형식 | 도구, 루프, 오류 처리, 상태 |
| 목적 | 단발 출력 품질 | 복합 과제의 반복 가능한 수행 |
| 대표 기법 | Few-shot, CoT, Role | 도구 오케스트레이션, Retry/Guardrail |
| 실패 영향 | 그 응답의 품질 저하 | 워크플로 중단·오작동 |
하네스를 짤 때는 무한 루프 방지, 컨텍스트 길이, 도구 실패 시 재시도와 중단 조건이 핵심입니다.
Multimodal LLM
텍스트만이 아니라 이미지, 음성, 영상처럼 다른 양식(Modality)을 함께 이해하고, 필요하면 여러 양식으로 내보내는 LLM입니다. GPT-4V, Gemini 계열이 이 자리에 자주 놓입니다.
구성은 세 층입니다. 양식별 인코더(비전은 ViT 등, 음성은 Audio Encoder, 텍스트는 임베딩), 서로 다른 임베딩을 같은 의미 공간으로 맞추는 정렬·융합(, Projection), 그 결과를 받아 추론하는 언어모델 코어입니다.
처리 순서는 원시 이미지/음성 → 인코더 → 임베딩 → Fusion/Projection → LLM 코어(텍스트와 결합) → 통합 추론 → 출력입니다. 사진 QA, 차트·문서 이해, 음성 비서, 영상 요약·검색이 전형적인 활용입니다. 품질이 떨어지면 이후 코어가 아무리 좋아도 시각 과제는 무너집니다.
기술사 답안 포인트
기출 이력
제140회 정보관리기술사 1교시
관련 용어
관련 토픽
AI
RAG, RIG, MCP, MoE — LLM 최적화 기법
검색으로 지식을 붙이고, 생성 중 근거를 확인하고, 도구를 표준으로 연결하고, 필요한 전문가만 깨우는 네 가지 LLM 최적화 축을 구분합니다.
AI
sLLM — Smaller Large Language Model
초거대 LLM을 증류·양자화·가지치기로 줄여, 온프레미스와 온디바이스에서 낮은 지연으로 쓰는 소형 언어모델의 위치와 한계를 정리합니다.
AI
멀티모달 기술요소
텍스트·이미지·음성·센서를 한 표현 공간으로 모으는 인코더–융합–디코더와, Early/Late Fusion·크로스 어텐션, CLIP 정렬과 VQA 흐름을 정리합니다.