AI 에이전트 프롬프트 인젝션 방어 체크리스트

외부 콘텐츠를 읽고 도구를 실행하는 AI 에이전트에서 프롬프트 인젝션 위험을 줄이기 위해 신뢰 경계·권한·승인·로그를 점검하는 방어 가이드입니다.

  1. 1

    외부 콘텐츠를 명령이 아닌 데이터로 분리합니다

    웹페이지·문서·메일에서 읽은 문장을 시스템 지시와 같은 권한으로 실행하지 않도록 입력 경계를 둡니다.

  2. 2

    도구 권한을 작업별로 최소화합니다

    읽기, 쓰기, 발송, 결제처럼 영향이 다른 동작을 분리하고 불필요한 토큰·파일·네트워크 접근을 제거합니다.

  3. 3

    고위험 행동에는 사람 승인을 둡니다

    외부 전송·게시·삭제·권한 변경은 에이전트의 판단만으로 실행하지 않도록 명시적 승인 단계를 둡니다.

  4. 4

    입력과 행동을 기록하고 시험합니다

    도구 호출, 승인, 실패 원인을 기록하고 대표적인 우회 지시가 들어왔을 때 차단되는지 정기적으로 점검합니다.

읽은 문장이 곧 지시가 되지 않게 합니다

프롬프트 인젝션은 에이전트가 처리하는 웹페이지나 문서 안의 적대적 문장을 신뢰해 원래 목적에서 벗어나게 만들 수 있습니다. 외부 텍스트는 데이터로 취급하고, 시스템 지시와 도구 권한을 분리해야 합니다.

한 겹의 필터로 끝내지 않습니다

모델의 거절만으로는 충분하지 않습니다. 최소 권한, 위험 행동의 승인, 민감한 도구 결과 제한, 모니터링을 겹쳐 두어 한 방어가 실패해도 피해 범위를 줄입니다.

승인 지점은 행동의 영향에 맞춥니다

단순 조회와 외부 발송·게시·삭제는 같은 권한이 아닙니다. 되돌리기 어려운 행동은 사람의 확인을 요구하고, 왜 실행하려는지와 대상이 무엇인지 기록합니다.

공식 자료: Anthropic prompt-injection defenses · Trustworthy agents in practice