AgentesAplicações 🇷🇺 11.08.2026 16:02

Por que Redes Neurais Consomem Tokens: O Que Acontece em Conversas Longas e Como Reduzir Custos

AnthropicAnthropic SYNTX.AISYNTX.AI
Conversas longas com IA e janelas de contexto enormes aumentam os custos de tokens e podem degradar o desempenho do modelo. Um usuário do Reddit relatou gastar mais de um bilhão de tokens de entrada com Claude, enquanto outro acumulou cerca de 6.000 dólares em um agente de IA sem supervisão. Estudos como 'Context Rot' mostram que o desempenho cai à medida que o contexto cresce, e especialistas recomendam dividir tarefas, compactar o histórico e usar cache de prompt para economizar.
O artigo discute por que os modelos de IA consomem tokens em excesso em conversas longas e como reduzir custos. Ele cita anedotas do Reddit: um usuário queimou 1,156 bilhão de tokens de entrada com o Claude, outro esqueceu de parar um agente do Claude Code que verificava pull requests a cada 30 minutos por 26 horas, totalizando 46 execuções e custando cerca de 6.000 dólares. A razão técnica para os altos custos é que cada nova solicitação inclui todo o contexto acumulado, que pode chegar a 800 mil tokens. A Anthropic alerta em sua documentação que os custos aumentam com o tamanho do contexto e recomenda limpar o histórico ou usar compactação. Pesquisas da Chroma ('Context Rot') e um estudo de 2026 ('Diagnosticando e Mitigando a Rotação de Contexto') mostram que o desempenho degrada com entradas mais longas, mesmo antes do limite da janela de contexto, especialmente com informações distrativas. O cache de prompt apenas reduz custos para prefixos repetidos, não os problemas de contexto desnecessário. Para agentes de IA, os custos são ocultos porque eles realizam muitas operações de ferramentas autonomamente. Dicas práticas incluem dividir tarefas independentes, usar /clear e /compact no Claude Code, fornecer apenas seções relevantes de documentos, armazenar instruções estáveis em cache e escolher a camada certa do modelo (Sonnet para codificação, Opus para raciocínio complexo, Haiku para tarefas simples de subagentes). O autor também promove o LLM Studio da SYNTX.AI, que oferece mais de 100 modelos de IA e a capacidade de trocar de modelo dentro de um diálogo, com o código promocional CTRLAI para 20% de desconto. O artigo conclui que a engenharia de prompt agora deve incluir o descarte de informações desnecessárias.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas