Un paso de agente — 120 000 tokens: a dónde van y cómo lo solucionamos
Un agente autónomo puede consumir muchos más tokens de lo esperado debido al envío repetido del contexto completo en cada paso del bucle del agente. El artículo describe cómo Uma Computer descubrió que la causa real no era el historial de diálogo, sino la sobrecarga multiplicada de las instrucciones del sistema, los esquemas de herramientas y la memoria, y presenta tres optimizaciones: trasladar el volumen a herramientas bajo demanda, cambiar a un presupuesto de caracteres con marcadores de truncamiento explícitos y expectativas de velocidad transparentes.
Los desarrolladores de Uma Computer, un agente autónomo que realiza tareas como búsqueda web, generación de medios y edición de video, investigaron por qué una solicitud de usuario costaba 38 créditos en lugar del tercio de esa cantidad esperado. La facturación mostraba 119,208 tokens de entrada y solo 1,018 tokens de salida, lo que significa que el modelo estaba principalmente leyendo, no escribiendo. La hipótesis inicial era un historial de diálogo largo, pero el diálogo problemático real tenía solo dos mensajes con un total de 530 caracteres. La medición reveló que el contexto por paso era de 13,900 tokens, y con 9 pasos el total alcanzaba unos 120,000 tokens; la sobrecarga se multiplicaba por el número de pasos en el bucle del agente. Además, el proveedor reserva el costo del peor caso con max_tokens establecido en alto, lo que provoca errores HTTP 402 incluso con saldo suficiente. La solución implicó mover el contexto precargado a herramientas bajo demanda, usar un presupuesto de caracteres con prioridades y marcadores de truncamiento explícitos, y hacer transparentes las expectativas de velocidad. El artículo enfatiza que el contexto nunca debe ocultarse silenciosamente al modelo, y que las optimizaciones deben verificarse en casos concretos, ya que casi optimizan para un caso donde el historial era irrelevante.
Fuente: Habr — хаб ML —
original
