⚡ 속보
모델에이전트 🇺🇸 26.07.2026 16:05

Anthropic, Claude Opus 5 출시: 에이전트 코딩 및 컴퓨터 작업, 기존 Opus 가격 유지

AnthropicAnthropic
Anthropic이 새로운 플래그십 모델인 Claude Opus 5를 출시했습니다. 이 모델은 향상된 에이전트 기능, 변경 없는 가격(토큰 100만 개당 $5/$25), 그리고 100만 토큰 컨텍스트 윈도우를 제공합니다. 코딩, 사이버보안 및 자율 작업 벤치마크에서 상당한 성능 향상을 보였으며, 업데이트된 사고 메커니즘과 수정된 안전 정책이 적용되었습니다.
Anthropic이 Opus 4.8을 대체하는 플래그십 Opus 레벨 모델인 Claude Opus 5를 출시했습니다. 가격은 동일하게 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러입니다. 이 모델은 절반 가격에 Claude Fable 5에 근접한 지능을 제공하며, 현재 Claude Max의 기본 모델이자 Claude Pro에서 가장 강력한 모델입니다. API 레벨에서는 세 가지 주요 변경 사항이 있습니다: 사고(thinking)가 기본으로 활성화되며(effort 매개변수가 깊이를 제어), 사고 비활성화(type: disabled)와 effort xhigh 또는 max를 함께 사용하면 400 오류가 반환되며, 개발자는 모델이 이미 자체 점검을 수행하므로 "최종 점검 활성화"와 같은 프롬프트를 제거하는 것이 좋습니다. 모델 ID는 claude-opus-5이며, 컨텍스트 창은 100만 토큰(최대 및 기본값)이고, 최대 출력은 동기 Messages API를 통해 128k 토큰, Message Batches API를 통해 최대 300k 토큰입니다. 벤치마크에서 모델은 상당한 성장을 보였습니다: FrontierBench v0.1에서 43.3%(Opus 4.8은 18.7%), SWE-bench Verified에서 96.0%, OSWorld 2.0에서 70.57%, Zapier AutomationBench에서 26.0%를 기록했습니다. 에이전트 결과가 가장 강력합니다: 모델은 IMO 2026 문제 42개 중 42개를 해결했습니다(금메달). ARC-AGI-3에서 높은 effort로 30.16%를 기록하며 이전 기록보다 4배 향상되었습니다. 멀티모달 작업에서 도구(컨테이너, 이미지 크롭)는 "사고"보다 훨씬 효과적입니다: Chartography에서 도구 사용 시 83.0% vs 29.6%입니다. 사이버 보안에서 부수 효과로 능력이 향상되었습니다: ExploitBench에서 모델은 10.14 플래그와 99개의 완전한 익스플로잇을 획득했습니다(Mythos 5는 132개). Anthropic은 소스 코드 취약점 탐지에 대한 제한만 완화했으며, 바이너리 스캐닝, 침투 테스트, 익스플로잇 생성은 여전히 차단됩니다. 분류기는 Fable 5보다 약 85% 덜 자주 작동할 것입니다. UK AISI 테스트에서 모델은 "The Last Ones" 작업을 10번의 시도 중 8번 해결했습니다. RSP 프로그램에 따르면, 모델은 CB-1 능력을 갖추고 있지만 CB-2 능력은 없습니다. 프롬프트 인젝션 저항에서 뛰어난 결과를 보였습니다: 브라우저 공격이 보호 없이 31.5%에서 3.70%로, 자동 모드에서는 0%로 감소했습니다. 그러나 회사는 Opus 4.8과 비교하여 사실적 환각 비율이 약간 더 높은 단점도 공개했습니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스