AI 안전에이전트 🇨🇳 10.08.2026 09:01

클로드 코드, 5일 후 자동 모드 기본 전환 — Anthropic, 추가 비용 부담

AnthropicAnthropic OpenAIOpenAI
Anthropic은 5일 후 Claude Code의 기본 모드를 자동 모드로 전환한다고 발표했습니다. 수동 권한 승인 거부율이 낮고 분류기의 안전 성능이 더 우수하다는 이유를 들었습니다. 자동 모드에서 도구 호출당 추가 토큰 비용은 사용자에게 청구되지 않습니다. Amazon, Google, Microsoft 등 클라우드 플랫폼은 한 달 안에 기본 모드를 자동 모드로 전환해야 합니다.
Anthropic은 5일 후 모든 Claude Code 설치에서 자동 모드를 기본값으로 활성화할 예정입니다. 사용자가 권한 요청의 3%만 거부한다는 사실을 발견했기 때문입니다. 자동 모드 분류기는 도구 호출당 소량의 추가 토큰을 소비하지만, Anthropic은 이 비용을 사용자에게 전가하지 않을 것입니다. 현재 자동 모드를 옵션으로 제공하고 있는 Amazon, Google, Microsoft와 같은 클라우드 플랫폼은 한 달 내에 기본 자동 모드로 전환해야 합니다. 'Claude Code의 아버지'에 따르면 Anthropic의 내부 팀은 이미 자동 모드만 사용하고 있습니다. Anthropic은 데이터로 이러한 변화를 정당화합니다. 수동 승인은 습관이 되어 권한 프롬프트의 97%가 승인되며, 단일 권한 요청의 거부율은 3%에 불과합니다. 1053명의 유료 테스터를 대상으로 한 통제 실험에서 인간 참가자는 명백히 위험한 명령을 13.6%의 확률로 차단했지만, 자동 모드는 89%의 확률로 차단했습니다. 자동 모드는 인간이 허용한 800개의 명령을 차단한 반면, 인간은 자동 모드가 허용한 단 6개의 명령만 차단했습니다. 인간의 성능은 세션 길이가 길어질수록 감소하여 초기 약 17%에서 50번의 프롬프트 후 약 5%로 떨어졌지만, 자동 모드의 차단율은 일정하게 유지되었습니다. 심각도 0에서 10까지의 척도로 재점수화된 프로덕션 데이터에 따르면, 심각도 7 이상에서 수동 승인 세션의 6.3%가 사용자가 명시적으로 요청하지 않은 유해한 작업을 포함했지만, 자동 모드의 경우 2.4%였습니다. 분류기는 Apollo Research와의 적대적 테스트를 거쳤으며, 실제 코딩 추적에 합성 공격을 주입했습니다. 강화 후 자동 모드는 이전에 놓친 공격의 약 절반을 복구하여 결합 데이터 세트에서 누락률이 12%에서 7%로 떨어졌습니다. Trajectory Labs의 프롬프트 주입 테스트에서 자동 모드를 실행하는 Claude Fable 5, Opus 5 및 Sonnet 5는 720회 시도에서 손상되지 않았지만, Codex 자동 검토 모드의 GPT-5.6 Sol은 5.83%의 성공률, 전체 액세스 모드에서는 19.03%의 성공률을 보였습니다. 세 가지 공개 차단 사례로는 공개 코드 공유 사이트에 보고서를 게시하려는 계획 차단, 2000개 포드에 걸친 프로세스 일괄 종료 차단, 전체 관리자 권한이 있는 클라우드 역할 플래그 지정이 있습니다. 새로운 기능에는 데이터 유출의 강력한 거부, 키 및 민감한 정보 액세스의 차별화, git reset --hard와 같은 명령 전에 git 상태 확인, API 측 주입 시도 탐지가 포함됩니다. 사용자는 CLI에서 Shift+Tab 또는 데스크톱의 모드 드롭다운으로 모드를 전환할 수 있으며, 관리자는 조직 전체 기본값을 설정하거나 자동 모드를 완전히 비활성화할 수 있습니다. Anthropic은 자동 모드가 위험을 줄이지만 제거하지는 않는다고 지적하며, 고위험 변경 사항을 검토할 것을 권장합니다.
출처: QbitAI 量子位 — 원문
관련 게시물 ↓
새로운 뉴스