PE Notes · 보안
생성형 AI 보안위협 가이드라인
비결정 출력과 자연어 공격면을 입력·모델·출력 세 층으로 나누고, 도입 전 정책, 사용 중 필터·검증, 운영 레드티밍과 최소 권한·인간 검토 원칙을 정리합니다.
생성형 서비스는 SQL이 아니라 문장이 입력입니다. 같은 질문에 답이 바뀌고, 문서와 플러그인이 곧 실행 면이 됩니다. 기존 WAF만으로는 의도를 못 봅니다. 이 글은 위협을 세 층으로 가른 뒤, 도입–사용–운영 가이드 순서로 손을 둡니다. 이 목록이라면, 여기는 조직 지침입니다.
정의
생성형 AI 보안 가이드라인은 LLM 서비스를 들여올 때 쓰는 위협 분류, 평가 기준, 대응 묶음입니다. 다섯 특성이 전통 앱과 갈립니다.
| 특성 | 한 줄 |
|---|---|
| 비결정성 | 같은 입력도 출력이 달라 회귀 검증이 어렵다 |
| 프롬프트 면 | 자연어가 새로운 인젝션 벡터다 |
| 데이터 의존 | 오염 한 줌이 모델 전체에 퍼진다 |
| 블랙박스 | 중간 추론을 감사하기 어렵다 |
| 에코시스템 | 플러그인·API·에이전트가 면을 넓힌다 |
세 층 위협
| 층 | 위협 | 한 줄 |
|---|---|---|
| 입력 | 사용자 문구가 시스템 지시를 덮는다 | |
| 입력 | RAG 문서·웹·메일에 숨은 지시 | |
| 입력 | 역할극·우회 표현으로 정책을 푼다 | |
| 모델 | 오염·탈취·추출 | 학습 변조, API 복제, 시스템 프롬프트·학습 기밀 유출 |
| 출력 | 악용 | 가짜 인용·법령을 사실처럼 쓰게 한다 |
| 출력 | 대량 허위·악성 코드 | 생성기를 남용 도구로 쓴다 |
직접 인젝션은 사용자가 치고, 간접은 모델이 읽게 된 바깥 텍스트가 칩니다. 메일 요약 에이전트가 본문에 있는 “이전 지시를 무시하라”를 수행하는 그림입니다.
단계별 원칙
도입 전: 허용·금지 범위를 문서로 정하고, 개인정보·영업비밀 입력을 금지하며, 서비스별 위험을 평가합니다. 사용 중: 시스템 프롬프트를 숨기고, PII·기밀을 걸러 을 걸며, 중요 출력은 사람이 확인합니다. 로그를 남깁니다. 운영: 정기 , 플러그인·API 검토, 사고 절차입니다.
| 비교축 | 전통 앱 보안 | 생성형 AI 보안 |
|---|---|---|
| 벡터 | , XSS | 프롬프트 인젝션, 탈옥 |
| 입력 검증 | 형식·범위 | 의미·의도 필터 |
| 출력 신뢰 | 결정론 | 비결정·환각 → 검증 필수 |
| 감사 | 로그로 재현 | 재현이 어렵다 |
| 도구 | WAF, IDS | 입출력 필터, 가드레일 |
세 원칙으로 줄이면 (모델에 줄 데이터와 도구를 줄인다), 투명성(AI 사용을 알린다), 인간 검토(중요 산출물은 사람이 본다)입니다.
| 사고 유형 | 교훈 |
|---|---|
| 소스·회의록을 외부 LLM에 붙여 넣음 | 기밀 입력 금지와 DLP |
| 가짜 판례·인용을 그대로 제출 | 출력 검증 의무 |
| 요약기가 악성 메일 지시를 수행 | 간접 인젝션 격리 |
저작권 가이드가 학습·출력물의 권리 축이라면, 여기서는 유출과 오용입니다. 기업망과 외부 LLM 사이에 보안 게이트웨이를 두는 것이 운영의 다음 손입니다.
관련 용어
관련 토픽
AI
OWASP Top 10 for LLM
웹 취약점 목록으로는 잡히지 않는 LLM 서비스의 열 가지 위협을 입력·모델·출력·도구 층으로 읽고, 프롬프트 인젝션과 단계별 가드레일을 구분합니다.
AI
생성형 AI 저작권과 이용자 보호
학습 데이터 이용과 AI 생성물 귀속이라는 저작권 쟁점을 개발사·창작자 입장으로 가르고, 고지·워터마크·자동화 결정 이의 등 이용자 보호 항목을 대응표로 정리합니다.
AI
적대적공격과 생성형 AI 보안취약점
학습·추론 단계를 가르는 적대적공격 네 유형과, 프롬프트 인젝션부터 도구 연동까지 생성형 AI의 공격 표면을 구분합니다.