⚡ ÚLTIMA HORA
ModelosAgentes 🇺🇸 26.07.2026 16:05

Anthropic Lança Claude Opus 5: Tarefas Agentes de Codificação e Computador pelo Mesmo Preço do Opus

AnthropicAnthropic
A Anthropic lançou o Claude Opus 5, um novo modelo principal com capacidades agentes aprimoradas, preços inalterados (US$ 5 / US$ 25 por milhão de tokens) e uma janela de contexto de 1 milhão de tokens. O modelo apresenta ganhos significativos em benchmarks de codificação, segurança cibernética e tarefas autônomas, com um mecanismo de raciocínio atualizado e políticas de segurança revisadas.
A Anthropic lançou o Claude Opus 5, substituindo o Opus 4.8 como o modelo principal da linha Opus. Os preços permanecem os mesmos: US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. O modelo se aproxima do Claude Fable 5 em inteligência pela metade do preço e agora é o modelo padrão no Claude Max e o mais poderoso no Claude Pro. Na API, três mudanças principais ocorreram: o pensamento está habilitado por padrão (o parâmetro effort controla a profundidade); desabilitar o pensamento (definindo type: disabled) com effort xhigh ou max agora retorna um erro 400; os desenvolvedores são aconselhados a remover prompts como "enable final check", pois o modelo já faz autoverificação. O ID do modelo é claude-opus-5, a janela de contexto é de 1 milhão de tokens (máximo e padrão), a saída máxima é de 128 mil tokens via API síncrona de Mensagens e até 300 mil via API de Lotes de Mensagens. Nos benchmarks, o modelo mostrou crescimento significativo: no FrontierBench v0.1 — 43,3% (Opus 4.8 — 18,7%), no SWE-bench Verified — 96,0%, no OSWorld 2.0 — 70,57%, no Zapier AutomationBench — 26,0%. Os resultados agênticos são os mais fortes: o modelo resolveu 42 de 42 problemas da IMO 2026 (medalha de ouro). No ARC-AGI-3 com alto esforço — 30,16% (4 vezes melhor que o recorde anterior). Em tarefas multimodais, as ferramentas (containers, corte de imagem) são significativamente mais eficazes do que o "pensamento": no Chartography com ferramentas — 83,0% vs. 29,6%. Em cibersegurança, as capacidades aumentaram como efeito colateral: no ExploitBench, o modelo obteve 10,14 flags e 99 exploits completos (Mythos 5 — 132). A Anthropic apenas relaxou as restrições na caça a vulnerabilidades em código-fonte; a varredura de binários, o teste de penetração e a geração de exploits permanecem bloqueados. Os classificadores acionarão aproximadamente 85% menos vezes do que no Fable 5. Nos testes da AISI do Reino Unido, o modelo resolveu a tarefa "The Last Ones" em 8 de 10 tentativas. De acordo com o programa RSP, o modelo tem capacidades CB-1, mas não CB-2. Resultado notável em resistência a injeção de prompt: os ataques via navegador caíram de 31,5% para 3,70% sem proteção e para 0% com modo automático. No entanto, a empresa também divulga desvantagens, incluindo uma taxa ligeiramente maior de alucinações factuais em comparação com o Opus 4.8.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas