PE Notes · AI
적대적공격과 생성형 AI 보안취약점
학습·추론 단계를 가르는 적대적공격 네 유형과, 프롬프트 인젝션부터 도구 연동까지 생성형 AI의 공격 표면을 구분합니다.
네트워크와 서버를 지키는 전통 보안과 달리, 적대적공격은 모델이 어떻게 배우고 답하는지를 표적으로 삼습니다. 생성형 AI에서는 자연어 입력 자체가 공격 경로가 됩니다. 이 글은 먼저 네 유형을 시점으로 나누고, 이어서 LLM 서비스의 공격 표면을 입력·모델·출력·도구로 읽습니다.
적대적공격 네 유형
시점 기준으로 보면 학습 단계와 추론 단계로 갈립니다. 학습은 데이터를 오염시키는 쪽이고, 추론은 이미 배포된 모델에 질의하는 쪽입니다.
| 유형 | 시점 | 무엇을 노리는가 |
|---|---|---|
| 학습 | 학습 데이터에 악의 샘플을 넣어 모델 자체를 왜곡하거나 백도어를 심는다. | |
| 추론 | 눈에 잘 안 띄는 노이즈()로 오분류를 유도한다. | |
| 추론 | API를 반복 질의해 구조·파라미터를 근사 복제한다. | |
| 추론 | 출력에서 학습에 쓰인 원본·민감정보를 거꾸로 추정한다. |
| 비교축 | 회피 | 오염 | 추출 | 역전 |
|---|---|---|---|---|
| 공격 대상 | 입력 | 학습 데이터·파이프라인 | 모델(지적재산) | 학습 데이터(프라이버시) |
| 필요 권한 | 추론 API | 학습 파이프라인 | 추론 API | 추론 API |
| 주요 피해 | 오분류·오작동 | 신뢰 붕괴, 백도어 | 모델 유출 | 개인정보 유출 |
| 탐지 | 입력 이상탐지가 가능 | 학습 시점에 숨기기 쉽다 | 질의 패턴 감시 | 어렵다 |
대응도 시점에 맞춥니다. 회피에는 적대적 학습으로 강건성을 올리고, 오염에는 데이터 출처·검증을 붙입니다. 추출에는 질의 속도제한과 워터마킹, 역전에는 가 대표입니다.
생성형 AI 보안취약점
LLM 서비스는 입력이 곧 코드에 가깝습니다. 문장으로 지시를 덮어쓰거나, 안전장치를 우회하거나, 출력을 허위·합성 미디어로 쓰는 경로가 생깁니다.
| 단계 | 취약점 | 요지 |
|---|---|---|
| 입력 | 악의 지시로 원래 시스템 프롬프트를 무시하게 한다. | |
| 입력 | 가드레일을 우회해 금지 출력을 유도한다. | |
| 입력 | Model DoS | 긴 입력·반복 질의로 추론 자원을 고갈시킨다. |
| 모델 | 학습데이터 유출 | 반복 질의로 학습 원문·개인정보를 끌어낸다. |
| 모델 | 공급망 | 사전학습 가중치, 플러그인, 서버 등 외부 구성 요소를 탄다. |
| 출력 | 환각·허위정보 | 을 의도적으로 써서 거짓을 퍼뜨린다. |
| 출력 | 딥페이크 | 이미지·음성 합성으로 사칭·사기에 쓴다. |
| 도구연동 | MCP·플러그인 | 도구 호출 권한으로 파일·API까지 공격이 번진다. |
전통 앱 보안과 갈라지는 지점은 자연어가 공격 벡터라는 점입니다. OWASP Top 10 for LLM Applications가 이 유형을 정리한 참고 틀입니다.
대응은 입력 필터와 지시 계층(Instruction Hierarchy), 출력 검열·사실 검증, 도구 호출의 최소 권한, 그리고 배포 전 입니다. 제도 축으로는 NIST AI RMF, 국내 AI 기본법·생성형 AI 이용자 보호 가이드가 같이 거론됩니다.
기술사 답안 포인트
관련 용어
관련 토픽
AI
모델 평가와 신뢰성 AI
분류·회귀·생성·군집·검증으로 나눈 평가 지표와, 안전성·공정성·설명가능성 등 신뢰성 AI의 핵심 속성을 한 장에서 연결합니다.
AI
OWASP Top 10 for LLM
웹 취약점 목록으로는 잡히지 않는 LLM 서비스의 열 가지 위협을 입력·모델·출력·도구 층으로 읽고, 프롬프트 인젝션과 단계별 가드레일을 구분합니다.
AI
RAG, RIG, MCP, MoE — LLM 최적화 기법
검색으로 지식을 붙이고, 생성 중 근거를 확인하고, 도구를 표준으로 연결하고, 필요한 전문가만 깨우는 네 가지 LLM 최적화 축을 구분합니다.