⚡ ÚLTIMA HORA
ModelosAgentes 🇺🇸 26.07.2026 16:05

Anthropic presenta Claude Opus 5: tareas de codificación agénticas y tareas informáticas al mismo precio de Opus

AnthropicAnthropic
Anthropic ha lanzado Claude Opus 5, un nuevo modelo insignia con capacidades agénticas mejoradas, precios sin cambios ($5/$25 por millón de tokens) y una ventana de contexto de 1 millón de tokens. El modelo muestra ganancias significativas en codificación, ciberseguridad y puntos de referencia de tareas autónomas, con un mecanismo de razonamiento actualizado y políticas de seguridad revisadas.
Anthropic ha lanzado Claude Opus 5, que reemplaza a Opus 4.8 como el modelo insignia de nivel Opus. Los precios se mantienen iguales: $5 por millón de tokens de entrada y $25 por millón de tokens de salida. El modelo se acerca a Claude Fable 5 en inteligencia a la mitad del precio y ahora es el modelo predeterminado en Claude Max y el más potente en Claude Pro. A nivel de API, se han producido tres cambios clave: el pensamiento está habilitado por defecto (el parámetro de esfuerzo controla la profundidad); deshabilitar el pensamiento (establecer tipo: deshabilitado) con esfuerzo xhigh o max ahora devuelve un error 400; se recomienda a los desarrolladores eliminar indicaciones como "habilitar verificación final", ya que el modelo ya se autocontrola. El ID del modelo es claude-opus-5, la ventana de contexto es de 1M de tokens (máximo y predeterminado), la salida máxima es de 128k tokens a través de la API síncrona de Mensajes y hasta 300k a través de la API de Lotes de Mensajes. En los puntos de referencia, el modelo mostró un crecimiento significativo: en FrontierBench v0.1 — 43.3% (Opus 4.8 — 18.7%), en SWE-bench Verificado — 96.0%, OSWorld 2.0 — 70.57%, Zapier AutomationBench — 26.0%. Los resultados agénticos son los más sólidos: el modelo resolvió 42 de 42 problemas de la OMI 2026 (medalla de oro). En ARC-AGI-3 con alto esfuerzo — 30.16% (4 veces mejor que el récord anterior). En tareas multimodales, las herramientas (contenedores, recorte de imágenes) son significativamente más efectivas que el "pensamiento": en Chartography con herramientas — 83.0% frente al 29.6%. En ciberseguridad, las capacidades aumentaron como efecto secundario: en ExploitBench el modelo obtuvo 10.14 banderas y 99 exploits completos (Mythos 5 — 132). Anthropic solo relajó las restricciones en la búsqueda de vulnerabilidades en código fuente; el escaneo de binarios, las pruebas de penetración y la generación de exploits siguen bloqueados. Los clasificadores se activarán aproximadamente un 85% menos que en Fable 5. En las pruebas de AISI del Reino Unido, el modelo resolvió la tarea "Los Últimos" en 8 de 10 intentos. Según el programa RSP, el modelo tiene capacidades CB-1, pero no CB-2. Resultado sobresaliente en resistencia a la inyección de indicaciones: los ataques desde navegador cayeron del 31.5% al 3.70% sin protección y al 0% con modo automático. Sin embargo, la empresa también publica aspectos negativos, incluida una tasa ligeramente mayor de alucinaciones fácticas en comparación con Opus 4.8.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas