PE Notes · 보안
고성능 AI 모델 사이버보안
대규모 모델의 학습·배포·추론 생애주기에서 오염·백도어·탈취·인젝션을 가르고, 차분 프라이버시·워터마크·레드티밍과 전통 보안의 차이를 정리합니다.
대형 언어·멀티모달 모델이 의료·금융·행정에 붙으면, 모델 자체가 표적입니다. 네트워크와 앱 계층만 보던 보안은 세 면이 비어 있습니다. 학습 데이터, 파라미터, 추론 입출력입니다. 적대적 공격 토픽이 유형 분류라면, 여기서는 생애주기 대응을 표에 올립니다.
정의
고성능 AI 사이버보안은 대규모 모델을 데이터 수집부터 서비스 종료까지 지키는 체계입니다. 흐름은 수집 → 학습 → 배포 → 추론이고, 각 칸에 오염, 백도어, 탈취, 인젝션이 앉습니다. 인프라와 에이전트 권한이 열리면 같은 공격이 GPU 클러스터와 도구 호출까지 번집니다.
학습 단계
| 위협 | 한 줄 | 대응 |
|---|---|---|
| 악성 샘플로 특정 트리거 오작동을 심는다 | 출처 검증, 이상치 탐지, 정제 파이프라인 | |
| 트리거에만 숨은 동작을 넣는다 | 활성화 군집, Neural Cleanse류 탐지 | |
| 사전학습 가중치·라이브러리에 악성을 심는다 | 모델 서명, SBOM, 신뢰 허브 |
사전학습 체크포인트를 그대로 가져오면, 앱 취약점보다 먼저 모델이 뚫립니다.
배포와 추론
| 위협 | 한 줄 | 대응 |
|---|---|---|
| API를 반복해 기능을 복제한다 | 속도 제한, 출력 노이즈, | |
| 출력에서 학습 샘플을 되돌린다 | , 출력 일반화 | |
| 특정 행이 학습에 들어갔는지 맞힌다 | DP, 출력 교란 | |
| 입력 지시로 시스템 프롬프트를 덮는다 | 입력 필터, 프롬프트 격리, 샌드박스 | |
| 안전 정책을 역할극으로 우회한다 | 정렬 강화, 출력 감시, | |
| 모델 DoS | 긴 컨텍스트·반복 질의로 서비스를 멈춘다 | 토큰·속도 한도, 이상 트래픽 |
| 작은 노이즈로 오분류를 유도한다 | 적대 훈련, 입력 전처리, 앙상블 |
워터마크는 트리거 입출력 쌍이거나 생성 통계 패턴입니다. 탈취 의심 시 출처를 가립니다. 차분 프라이버시는 인접 데이터셋의 출력 분포를 가깝게 만듭니다. ε가 작을수록 보호는 강하고 정확도는 떨어집니다.
전통과의 비교
| 비교축 | 전통 사이버보안 | AI 모델 보안 |
|---|---|---|
| 대상 | OS, 네트워크, 앱 | 데이터, 가중치, 입출력 |
| 공격 | 익스플로잇, 멀웨어 | 오염, 적대 입력, 인젝션 |
| 탐지 | 시그니처, 이상 탐지 | 활성화 분석, 통계 검정, 레드티밍 |
| 규범 | ISO 27001, NIST CSF | , , |
RMF의 Govern–Map–Measure–Manage와 LLM Top 10의 입력·도구 층은 운영 체크리스트가 됩니다. 권한이 넓은 에이전트·MCP는 인젝션 한 번이 실행이 됩니다.
| 비교축 | 오염 | 탈취 | 인젝션 |
|---|---|---|---|
| 단계 | 학습 | 배포·API | 추론 |
| 탐지 | 중간 (데이터 감사) | 낮음 (정상 질의처럼) | 높음 (정상 문장) |
| 피해 | 숨은 오작동 | IP·기능 복제 | 정책 우회·도구 오용 |
자동화 레드티밍은 모델이 모델을 공격합니다. 사람 팀과 같이 둡니다.
기출 이력
제140회 정보관리기술사 2교시