AgentesNegócios e Mercado 🇷🇺 31.07.2026 17:02

Um passo do agente — 120.000 tokens: para onde vão e como corrigimos

Um agente autônomo pode consumir muito mais tokens do que o esperado devido ao envio repetido do contexto completo em cada etapa do loop do agente. O artigo descreve como a Uma Computer descobriu que a causa real não era o histórico do diálogo, mas a sobrecarga multiplicada das instruções do sistema, esquemas de ferramentas e memória, e apresenta três otimizações: mover o volume para ferramentas sob demanda, mudar para um orçamento de caracteres com marcadores explícitos de truncamento e expectativas transparentes de velocidade.
Os desenvolvedores da Uma Computer, um agente autônomo que realiza tarefas como busca na web, geração de mídia e edição de vídeo, investigaram por que uma solicitação de usuário custou 38 créditos em vez do terço esperado. A cobrança mostrou 119.208 tokens de prompt e apenas 1.018 tokens de conclusão, o que significa que o modelo estava principalmente lendo, não escrevendo. A hipótese inicial foi um longo histórico de diálogo, mas o diálogo problemático real tinha apenas duas mensagens totalizando 530 caracteres. A medição revelou que o contexto por etapa era de 13.900 tokens, e com 9 etapas o total chegou a cerca de 120.000 tokens; a sobrecarga multiplicava-se pelo número de etapas no loop do agente. Além disso, o provedor reserva o custo do pior caso com max_tokens definido alto, causando erros HTTP 402 mesmo com saldo suficiente. A correção envolveu mover o contexto pré-carregado para ferramentas sob demanda, usar um orçamento de caracteres com prioridades e marcadores explícitos de truncamento, e tornar as expectativas de velocidade transparentes. O artigo enfatiza que o contexto nunca deve ser silenciosamente ocultado do modelo, e que as otimizações devem ser verificadas em casos concretos, pois quase otimizaram para um caso onde o histórico era irrelevante.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas