Agentes 🇷🇺 30.07.2026 17:01

Por que um Agente de IA é na Realidade Mais Barato que RAG

Embora um assistente RAG clássico pareça mais barato por consulta, custos ocultos como perguntas de acompanhamento do usuário e escalonamentos para operadores tornam-no mais caro no geral. Um agente usando um loop ReAct busca autonomamente em múltiplos documentos até encontrar a resposta completa, transformando um processo de 3 tentativas e 27 minutos em uma única resposta de 4 minutos. Dados reais de um projeto piloto de suporte confirmam que agentes fecham perguntas a um terço do custo de um assistente RAG.
O artigo argumenta que a comparação ingênua de custos entre um assistente RAG e um agente é enganosa. Um assistente RAG clássico faz uma chamada de LLM e depende do usuário para refinar a consulta se a resposta estiver errada. Na prática, os usuários frequentemente desistem após 2 a 3 tentativas, escalando para um operador humano que gasta de 10 a 15 minutos resolvendo o caso. Isso resulta em muito mais do que uma única chamada de LLM. Um agente baseado no loop ReAct itera autonomamente sobre ferramentas de busca, formula hipóteses, recupera fragmentos e sintetiza uma resposta final sem intervenção do usuário. O agente ISTOK do autor usa cinco ferramentas: VectorSearch (híbrido denso+BM25 via Milvus), Search (busca textual completa em PostgreSQL), OpenChunk para ler fragmentos completos de documentos, GetDocumentChunks para sumário, e CallOperator como último recurso após 2 a 3 tentativas próprias. Para gerenciar os limites da janela de contexto, o agente primeiro tentou sumarização por LLM, mas achou cara e não confiável; agora usa uma janela deslizante (mantém as últimas 6 mensagens, descarta as mensagens de ferramentas mais antigas) com sumarização como fallback (no máximo 2 por sessão). As chamadas de LLM também são diferenciadas: embeddings e re-ranking baratos, geração leve para passos simples, média para raciocínio típico, e pesada apenas para síntese final ou sumarização. Em um piloto real com cerca de 1.200 documentos e 1.800 requisições mensais, o assistente teve média de 1 chamada de LLM, 2,3 follow-ups do usuário, taxa de escalonamento de 34%, tempo de fechamento de 27 minutos e aproximadamente 18.000 tokens por pergunta fechada. O agente teve média de 6,4 chamadas de LLM, 0,3 follow-ups, taxa de escalonamento de 11%, tempo de fechamento de 4 minutos e aproximadamente 15.500 tokens. Em custo direto, a pergunta fechada do assistente custou cerca de 52 rublos (incluindo custo do operador), enquanto a do agente custou cerca de 17 rublos, uma redução de três vezes. A vantagem do agente desaparece para perguntas factuais simples ou quando a base de conhecimento está vazia, pois ele desperdiça iterações. O agente registra o uso de tokens e o histórico de ferramentas de cada chamada, com rastreamento via Arize Phoenix para uma análise detalhada das iterações.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas