ModelosAgentes 🇺🇸 01.08.2026 02:01

DeepSeek mejora V4-Flash-0731: grandes avances en codificación agéntica y API beta

DeepSeekDeepSeek AnthropicAnthropic
DeepSeek lanzó DeepSeek-V4-Flash-0731, una actualización oficial de su vista previa, con mejoras significativas en los benchmarks de agente y codificación. El modelo mantiene la misma arquitectura pero se beneficia de un reentrenamiento posterior, y la API ahora está en beta pública con soporte para el formato de API Responses y adaptación de Codex. Los pesos tienen licencia MIT y sin restricciones, lo que permite amplias opciones de despliegue.
DeepSeek publicó DeepSeek-V4-Flash-0731 en Hugging Face y trasladó la API oficial de V4-Flash a beta pública el 31 de julio de 2026. La ficha del modelo indica que esta es la versión oficial que reemplaza a la vista previa, con arquitectura y tamaño sin cambios; las mejoras provienen de un re-entrenamiento posterior. El checkpoint incluye el módulo de decodificación especulativa DSpark, y Hugging Face reporta 304 mil millones de parámetros, incluido el módulo borrador sobre la base de 284 mil millones. La API ahora admite de forma nativa el formato de API de Responses y está adaptada para Codex, pero la API de V4-Pro y los modelos de aplicación y web no se actualizaron. El despliegue es posible mediante API a bajo costo (aproximadamente un tercio del precio de salida de Pro) o mediante autoalojamiento, que requiere recursos significativos: pesos con licencia MIT, pero todos los expertos permanecen en memoria. Un ejemplo de vLLM lo sirve en un nodo de 4×GB300; los GGUF dinámicos de Unsloth caben en unos 110 GB de memoria con cuantización agresiva. La arquitectura incluye 284 mil millones de parámetros con 13 mil millones activos por token, contexto de 1 millón de tokens, atención híbrida con CSA y HCA, y hiperconexiones restringidas por manifold. Los benchmarks muestran que V4-Flash-0731 supera a V4-Pro (Vista Previa) en todos los benchmarks agentivos, pero todas las cifras son reportadas por DeepSeek en un entorno de pruebas no publicado. DSpark se habilita con una bandera de vLLM, y el modelo usa una carpeta de codificación en lugar de una plantilla de chat Jinja.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas