에이전트AI 안전 🇩🇪 08.08.2026 18:02

Anthropic, 개발자 보호를 위해 Claude Code를 기본 자동 모드로 전환

AnthropicAnthropic OpenAIOpenAI
Anthropic은 8월 14일부터 Pro, Max, Team 요금제에서 Claude Code가 기본적으로 자동 모드로 실행되도록 할 예정입니다. 이 모드는 AI 코딩 도구가 자율적으로 작업할 수 있게 하며, 분류기가 위험한 작업을 확인합니다. 테스트 결과 수동 승인만큼 안전하면서도 생산성이 25% 향상되는 것으로 나타났습니다.
Anthropic은 Claude Code가 8월 14일부터 Pro, Max, Team 요금제에서 기본적으로 자동 모드로 전환된다고 발표했으며, Enterprise 고객은 옵트인해야 합니다. 자동 모드에서 AI 코딩 도구는 각 단계에서 수동 승인을 기다리지 않고 독립적으로 작동하며, 대신 분류기가 작업이 위험하거나 되돌릴 수 없는지 자동으로 확인하고 필요한 경우에만 확인을 요청합니다. Anthropic에 따르면, 1,053명의 유료 테스터와 내부 레드팀 테스트를 통해 자동 모드가 수동 승인보다 최소한 동등하거나 더 안전하다는 것이 입증되었으며, 자동 모드를 사용하는 팀은 약 25% 더 많은 풀 리퀘스트를 생성합니다. 또한 Anthropic은 자동 모드가 주입된 코드가 에이전트를 사용자 지시에서 이탈시키려는 프롬프트 인젝션 공격에 대한 추가 보호 계층을 제공한다고 강조합니다. Trajectory Labs의 독립 검토에서는 72가지 공격 시나리오를 각각 10회 테스트했으며, 720번의 공격 중 어느 것도 자동 모드에서 Claude의 현재 모델(Fable 5, Opus 5, Sonnet 5)을 상대로 성공하지 못한 반면, OpenAI의 GPT-5.6 Sol이 Codex 자동 검토 모드에서 5.83%의 공격이 성공했습니다. 내부적으로 자동 모드는 Claude가 기밀 데이터를 공개 페이지에 업로드하는 것과 긴 세션에서 약 2,000개의 프로세스를 종료하여 실행 중인 GPU 훈련 작업을 파괴하는 것을 방지했습니다. Anthropic은 분류기 자체가 소비하는 토큰에 대해 비용을 청구하지 않지만, 기본 자동 모드는 전체 토큰 사용량과 수익을 증가시키므로 회사에 경제적으로 매력적일 가능성이 높습니다. Claude Code는 현재 가장 널리 사용되는 AI 코딩 도구이며, 이 변화는 개발자 역할을 능동적 코딩에서 AI 생성 출력 모니터링으로 전환합니다. Anthropic은 분류기가 위험을 줄이지만 제거하지는 않는다고 지적하며, 프로덕션 중요 인프라에 주의를 권고합니다. 이는 역설을 만듭니다: 개발자가 덜 개입할수록 그들의 통제가 더 중요해지고, 대부분 자율적으로 생성된 프로젝트를 이해하는 것은 더 어려워집니다.
출처: The Decoder (DE) — 원문
관련 게시물 ↓
새로운 뉴스