¿Quién Lidera Realmente en el Desarrollo de Agentes? No es Quien Piensas
Anthropic
DeepSeek
OpenAI
Google/DeepMind
Alibaba/Qwen
Un experimento de producción de dos semanas realizado por un solo desarrollador utilizando codificación de agentes bajo un stack de gobernanza consumió 8.8 mil millones de tokens en 30,993 solicitudes. Los costos revelan una diferencia de precio de 72 veces entre los modelos de Anthropic y DeepSeek, impulsada por una tecnología de compresión de caché KV del 93%, haciendo que la gobernanza sea asequible solo con la arquitectura de DeepSeek.
El artículo informa que un experimento de producción de dos semanas en junio de 2026, donde un desarrollador utilizó herramientas de codificación agénticas con una pila de gobernanza, consumió 8.82 mil millones de tokens en 30,993 solicitudes, con un 99.38% de aciertos de caché. La sobrecarga de contexto para la gobernanza (políticas, habilidades, indicaciones de revisión) oscila entre 70,000 y 90,000 tokens por llamada. Los costos varían drásticamente según el modelo: el Sonnet 4.6 de Anthropic costaría $4,770 por la misma carga de trabajo con un acierto de caché realista del 92%, mientras que el DeepSeek V4 Pro costó solo $66.17, una diferencia de 72 veces. Esta brecha se debe a la Atención Latente de Múltiples Cabezas (MLA, por sus siglas en inglés) de DeepSeek, que comprime la caché KV en un 93.3%, permitiendo que las lecturas de caché sean casi gratuitas y que las cachés persistan durante días en SSD comerciales a través de 3FS, mientras que Anthropic, OpenAI y Google utilizan GQA/MHA con cachés que expiran en una hora debido a los límites de HBM. El artículo también menciona incidentes en Uber, Microsoft, Amazon, Pinterest y una empresa anónima, que muestran costos descontrolados por el uso agéntico sin control, y argumenta que la elección arquitectónica de DeepSeek hace que la gobernanza sea económicamente viable, a diferencia de alternativas más caras que obligan a los equipos a recortar medidas de seguridad.
Fuente: Habr — хаб ИИ —
original
