Agente por un dólar: la economía de la combinación Hermes Agent + DeepSeek V4 Flash
DeepSeek
Una captura de pantalla viral afirmaba que se procesaron cientos de millones de tokens por poco más de un dólar utilizando el agente de código abierto Hermes Agent sobre DeepSeek V4 Flash. Esta noticia explica los mecanismos detrás de estos costos tan bajos, centrándose en el almacenamiento automático en caché de prefijos, y detalla qué rompe la caché y las afirmaciones del proveedor.
A principios de agosto, una captura de pantalla circuló en X mostrando un panel con cientos de millones de tokens procesados y una factura de poco más de un dólar, supuestamente por usar el agente Hermes de código abierto con el modelo DeepSeek V4 Flash. El agente Hermes, desarrollado por Nous Research bajo la licencia MIT, funciona con cualquier endpoint compatible con OpenAI y cuenta con un bucle de aprendizaje cerrado, guardando las habilidades aprendidas en archivos markdown. DeepSeek V4 Flash, en beta pública desde el 31 de julio, utiliza la misma arquitectura que la vista previa de abril, pero con capacidades agénticas mejoradas tras el ajuste fino. El principal ahorro de costes no proviene de la tarifa base baja, sino del almacenamiento en caché automático de prefijos: los prefijos de prompts repetidos se facturan a una tarifa decenas de veces más baja. El bucle agéntico encaja casi perfectamente con esta mecánica, ya que cada llamada reenvía el mismo prompt del sistema y el historial, con solo unas pocas líneas nuevas añadidas. Sin embargo, el ahorro se rompe si los elementos en el encabezado del prompt cambian, como marcas de tiempo, identificadores de sesión o listas de herramientas reordenadas dinámicamente. El proveedor afirma que el modelo más pequeño supera al modelo de vista previa más grande en los benchmarks agénticos, pero recomienda usar el V4-Pro para razonamiento pesado. Los recargos por hora punta se anuncian pero aún no están activos, y el enrutamiento híbrido con escalada a Pro restablece la caché. El artículo proporciona las tarifas de precios, enumera los rompedores de caché comunes y aconseja sobre la planificación y consideraciones operativas, como los límites de velocidad y el perímetro de seguridad.
Fuente: Habr — хаб ИИ —
original
