Agentes 🇷🇺 30.07.2026 17:01

Por qué un agente de IA es en realidad más barato que RAG

Aunque un asistente RAG clásico parece más barato por consulta, los costos ocultos como seguimientos de usuarios y escalados a operadores lo hacen más caro en general. Un agente que utiliza un bucle ReAct busca autónomamente en múltiples documentos hasta encontrar la respuesta completa, convirtiendo un proceso de 3 intentos y 27 minutos en una sola respuesta de 4 minutos. Datos reales de un proyecto piloto de soporte confirman que los agentes cierran preguntas a un tercio del costo de un asistente RAG.
El artículo sostiene que la comparación ingenua de costos entre un asistente RAG y un agente es engañosa. Un asistente RAG clásico realiza una sola llamada al LLM y depende de que el usuario refine la consulta si la respuesta es incorrecta. En la práctica, los usuarios suelen rendirse después de 2 o 3 intentos, escalando a un operador humano que dedica de 10 a 15 minutos a resolver el caso. Esto suma mucho más que una sola llamada al LLM. Un agente basado en el bucle ReAct itera de forma autónoma sobre herramientas de búsqueda, formula hipótesis, recupera fragmentos y sintetiza una respuesta final sin intervención del usuario. El agente ISTOK del autor utiliza cinco herramientas: VectorSearch (híbrido denso + BM25 mediante Milvus), Search (texto completo en PostgreSQL), OpenChunk para leer fragmentos completos de documentos, GetDocumentChunks para el índice de contenidos, y CallOperator como último recurso tras 2 o 3 intentos propios. Para gestionar los límites de la ventana de contexto, el agente primero probó la síntesis con LLM, pero resultó costosa y poco fiable; ahora usa una ventana deslizante (conserva los últimos 6 mensajes, descarta los mensajes de herramientas más antiguos) con síntesis como recurso de reserva (máximo 2 por sesión). Las llamadas al LLM también se diferencian: embeddings y reranking baratos, generación ligera para pasos simples, media para razonamiento típico, y pesada solo para síntesis final o resumen. En un piloto real con aproximadamente 1200 documentos y 1800 solicitudes mensuales, el asistente promedió 1 llamada al LLM, 2.3 seguimientos del usuario, 34 % de tasa de escalado, 27 minutos para cerrar y alrededor de 18 000 tokens por pregunta cerrada. El agente promedió 6.4 llamadas al LLM, 0.3 seguimientos, 11 % de escalado, 4 minutos para cerrar y alrededor de 15 500 tokens. En costo directo, la pregunta cerrada del asistente costaba aproximadamente 52 rublos (incluyendo el costo del operador), mientras que la del agente costaba unos 17 rublos, una reducción a la tercera parte. La ventaja del agente desaparece para preguntas factuales simples o cuando la base de conocimiento está vacía, ya que desperdicia iteraciones. El agente registra el uso de tokens y el historial de herramientas de cada llamada, con trazado mediante Arize Phoenix para un desglose detallado de las iteraciones.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas