위험한 명령, 사람은 13.6%만 잡았다… 8/14부터 AI가 대신 막는다

Claude Code Auto Mode가 8월 14일부터 Pro·Max·Team 기본값이 된다. 자동 분류기 89% vs 수동 승인 13.6%, 반전 수치의 배경과 설정법을 짚었다.

H
Huuush발행 2026.08.08 · 4분 read에디터: Jay Kim

3줄 요약

  • 8월 14일부터 Claude Code Pro·Max·Team 사용자는 별도 설정 없이 Auto Mode가 기본값이 된다.
  • 1,053명의 유급 개발자를 대상으로 한 블라인드 통제 실험에서 위험 명령 탐지율은 사람이 13.6%, 분리된 분류기(Auto Mode)가 89%였고, 실제 세션 유해도는 각각 6.3%와 2.4%였다.
  • 사람의 차단율은 세션이 길어지면 초반 약 17%에서 이전 프롬프트 50개 초과 시 약 5%까지 떨어지는 반면, Auto Mode는 세션 길이와 무관하게 유지된다.
붉은 유리판과 검은 키보드 키캡이 마주한 모습으로 자동 승인 게이트를 형상화한 이미지
승인 게이트를 통과하는 명령을 상징한 생성 이미지

8월 14일부터 Claude Code Pro·Max·Team 사용자는 별도로 켜지 않아도 Auto Mode가 기본값이 된다. ClaudeDevs가 공개한 근거는 반전이다 — 위험한 명령을 사람은 13.6%만 잡았고, 분리된 분류기는 89%를 잡았다.

1,053명이 참여한 실험, 결과는 6배 차이

Anthropic 공식 발표에 따르면 이 수치는 1,053명의 유급 개발자를 대상으로 한 통제 실험에서 나왔다. 참가자들은 어떤 행동이 시험 대상인지 모르는 블라인드 상태였다. 결과는 다음과 같다.

구분위험 명령 탐지율실제 세션 유해도(프로덕션 심각도)
사람(수동 승인)13.6%(1,053건 중 143건)6.3%
Auto Mode(분류기)89%(1,053건 중 937건)2.4%

사람이 못 잡는 이유는 실력이 아니라 피로

더 눈에 띄는 건 세션이 길어질수록 벌어지는 격차다. 사람의 차단율은 세션 초반 약 17%에서 이전 프롬프트가 50개를 넘어가면 약 5%까지 떨어진다. 반복 승인에 익숙해지며 주의력이 떨어지는 현상이고, Auto Mode의 차단율은 세션 길이와 무관하게 유지된다.

브레이크 없는 자동화는 아니다

안전장치도 함께 왔다. 데이터 유출로 이어질 수 있는 명령은 사용자 override 없이는 하드 차단하고, 파괴적 작업 전에는 git 상태를 확인하며, 외부에서 들어온 콘텐츠는 프롬프트 인젝션 여부를 스크리닝한다. 연속 3회 또는 세션당 20회 차단이 쌓이면 수동 모드로 자동 전환된다.

지금 확인할 것 — 대상과 끄는 법

기본값 전환은 Pro·Max·Team 한정이다. Enterprise·API·AWS Bedrock·Google Cloud Agent Platform·Microsoft Foundry는 당분간 옵트인으로 남아 관리자가 검토할 시간을 확보했다. CLI에서 Shift+Tab이나 모드 드롭다운으로 바꿀 수 있고, 관리자는 managed settings의 defaultModedisableAutoMode 플래그로 조직 단위 정책을 정할 수 있다. 분류기 사용에 추가 비용은 없다.

출처: ClaudeDevs의 X 포스트 · Anthropic 공식 발표

자주 묻는 질문