PE Notes · 보안
딥러닝 취약점
학습의 오염·백도어와 추론의 적대 예시·멤버십·전도를 시점으로 가르고, 적대 훈련과 차분 프라이버시 대응을 표로 맞춥니다.
방화벽은 패킷을 보지만, 딥러닝은 입력 한 장의 미세한 기울기나 학습 세트 한 줌으로 판단이 접힙니다. 취약점은 코드 버그보다 손실 곡면과 데이터 파이프라인에서 납니다. 이 글은 시점으로 나누고, 생성형 AI 토픽보다 분류·비전 모델 일반에 초점을 둡니다.
단계로 나누기
학습 때는 데이터를 섞고, 추론 때는 이미 고정된 가중치를 흔들거나 출력으로 원문을 유추합니다. 배포 후에는 API 예산과 로그가 추출의 재료가 됩니다.
| 취약점 | 시점 | 피해 | 핵심 대응 |
|---|---|---|---|
| 추론 | 오분류 | 적대 훈련, 전처리 | |
| 학습 | 성능 저하·표적 오작동 | 출처 검증, 이상치 | |
| 학습 | 트리거만 오작동 | Neural Cleanse, 활성화 군집 | |
| 추론 | 학습 포함 여부 유출 | DP, 정규화 | |
| 추론 | 원문·속성 복원 | ||
| 추론 | 기능 복제 | 속도 제한, 워터마크 |
생성형 토픽이 프롬프트와 도구를 다면, 여기서는 같은 추출·전도가 이미지 분류 API에서도 열린다는 점을 강조합니다.
공격과 방어
은 손실 기울기 부호만큼 노이즈를 더합니다. PGD는 그 반복입니다. 사람은 판다로 보는데 모델만 다른 라벨을 줍니다. 백도어는 안경 테두리 같은 트리거가 있을 때만 허가로 바뀌어, 일반 테스트 정확도로는 안 잡힙니다.
| 비교축 | 적대 예시 | 오염 | 백도어 |
|---|---|---|---|
| 손대는 곳 | 추론 입력 | 학습 세트 | 학습 세트+트리거 |
| 평소 정확도 | 정상 입력은 유지 | 떨어질 수 있음 | 거의 유지 |
| 탐지 | 입력 검사, 인증 방어 | 통계 이상 | 트리거 역공학 |
| 대응 | 데이터 거버넌스 | 뉴런·스펙트럼 검사 |
멤버십은 이 클수록 학습 표본의 신뢰도가 튀어 쉬워집니다. 와 출력 반올림이 그 틈을 줄입니다.
운영 통제
학습 데이터 서명, API 쿼터, 모델 , 위험 관리 프레임이 모델 바깥 층입니다. 인증된 강건성은 “이 크기 아래 섭동에는 라벨이 안 바뀐다”는 수학 보증입니다.
| 층 | 수단 |
|---|---|
| 학습 | 출처, 이상치, 적대 훈련, DP |
| 서비스 | 속도 제한, 출력 뭉개기, 워터마크 |
| 거버넌스 | 위험 등급, 레드팀, 주기 평가 |
OWASP LLM이 프롬프트 층을 열거하면, 이 표의 추출·전도·과잉 권한이 그 목록과 맞닿습니다. 비전 스티커 공격과 프롬프트 인젝션은 매질만 다릅니다.