클로드 오퍼스 5: 아티피셜 애널리시스에 따르면 가장 똑똑한 모델 – 점수 뒤에 숨은 의미
Anthropic
OpenAI
앤트로픽은 2026년 7월 24일 클로드 오퍼스 5를 출시했으며, 최상위 모델인 클로드 페이블 5의 지능에 절반 가격으로 접근한다고 주장합니다. 아티피셜 애널리시스의 독립적 벤치마크 지수는 오퍼스 5를 1위(61점)로 선정했으며, 페이블 5보다 1점, GPT-5.6 솔보다 2점 앞섰습니다. 그러나 이 모델은 느리고 장황하며, 최대 노력 설정에서 과도하게 생각할 위험이 있다고 지적됩니다.
Anthropic은 2026년 7월 24일에 Claude Opus 5를 공개했으며, 이 모델은 Sonnet 5와 제한된 Fable/Mythos 5 사이에 위치합니다. 100만 토큰 컨텍스트 창, 12만 8천 출력을 갖추고 있으며, 추론 기능이 기본적으로 활성화되어 다섯 가지 노력 수준(낮음, 중간, 높음, 추가, 최대)을 제공합니다. 내부 벤치마크에서 Opus 5는 Frontier-Bench v0.1(에이전트 코딩)에서 43.3%를 기록했고, Opus 4.8은 18.7%, Fable 5는 33.7%였습니다. ARC-AGI-3(추상 추론)에서는 30.2%를 달성했으며, GPT-5.6 Sol은 7.8%였습니다. 그러나 독립적인 Artificial Analysis Intelligence Index는 Opus 5에 61점(최대 노력)을 부여했는데, 이는 Fable 5(60점)보다 1점 높고 GPT-5.6 Sol(59점)보다 2점 높은 수치로, 근소한 차이로 가장 똑똑한 모델이라고 선언했습니다. 이 모델은 눈에 띄게 느리고 장황한 것으로 묘사됩니다. 최대 노력 시 첫 토큰까지의 시간이 1분을 초과하며, 벤치마크 스위트의 총 토큰 소비량은 중앙값 약 6300만 토큰 대비 약 1억 토큰이었습니다. 승리에도 불구하고 Opus 5는 DeepSWE v1.1 에이전트 코딩(68.8% 대 GPT-5.6 Sol의 72.7%), HealthBench Professional(59.8% 대 Mythos 5의 66.0%), Legal Agent Benchmark(11.7% 대 Fable 5의 13.3%)에서 패배했습니다. Anthropic의 보고서는 Opus 5가 비전 없이 설계도를 받고, 작업을 해결하기 위해 원시 픽셀 데이터로 자체 컴퓨터 비전 프로그램을 작성한 반면, 경쟁사들은 실패한 사례를 강조합니다. 부정적인 측면에서, 1만 달러 예산과 24시간의 단백질 설계 테스트에서 Opus 5는 한 번의 실행에서 아무것도 제공하지 못했고, 다른 실행에서는 순위가 매겨지지 않은 17개의 변종만 제공하여 비생산적인 자기 검증 루프의 희생양이 되었습니다. 회사는 최대 노력이 과도한 사고로 이어질 수 있다고 경고하며, 코딩의 경우 추가 노력, 다른 작업의 경우 높은 노력부터 시작할 것을 권장합니다.
출처: Habr — хаб ИИ —
원문
