읽은 문장이 곧 지시가 되지 않게 합니다
프롬프트 인젝션은 에이전트가 처리하는 웹페이지나 문서 안의 적대적 문장을 신뢰해 원래 목적에서 벗어나게 만들 수 있습니다. 외부 텍스트는 데이터로 취급하고, 시스템 지시와 도구 권한을 분리해야 합니다.
한 겹의 필터로 끝내지 않습니다
모델의 거절만으로는 충분하지 않습니다. 최소 권한, 위험 행동의 승인, 민감한 도구 결과 제한, 모니터링을 겹쳐 두어 한 방어가 실패해도 피해 범위를 줄입니다.
승인 지점은 행동의 영향에 맞춥니다
단순 조회와 외부 발송·게시·삭제는 같은 권한이 아닙니다. 되돌리기 어려운 행동은 사람의 확인을 요구하고, 왜 실행하려는지와 대상이 무엇인지 기록합니다.
공식 자료: Anthropic prompt-injection defenses · Trustworthy agents in practice