Agente autónomo de IA monitorea logs de producción durante 4 meses: 113 alertas, 2 alucinaciones y una corrección en 3,5 horas
MiniMax
Anthropic
Un agente autónomo de IA ha estado monitoreando los logs de producción durante 84 días, generando 113 alertas, incluida una corrección crítica que se fusionó en 3,5 horas. A pesar de dos casos de alucinación del modelo, el equipo implementó pasos de verificación para reducir las alertas falsas. El sistema utiliza un runtime autohospedado, Grafana Loki y un modelo de IA rentable para mantener los gastos por debajo de los 10 dólares al mes.
El agente de IA monitorea los registros de producción de la plataforma Creatorry, que genera música, fotos y videos mediante IA. El sistema consta de 18 servicios, registrando aproximadamente 300.000 líneas diarias, de las cuales alrededor de 12.500 son errores o advertencias. El agente se ejecuta cada 30 minutos, consultando Loki en busca de errores recientes, y solo envía alertas a Telegram si detecta problemas críticos o un aumento significativo en las tasas de error. Durante 84 días, el agente emitió 113 alertas, con 69 errores, 41 críticos y tres entradas tempranas que carecían de etiquetas de severidad. La alerta más impactante detectó un error crítico a principios del 1 de junio, lo que llevó a una corrección que se fusionó en 3,5 horas. El agente también detectó una ola de errores 503 que reveló que no se estaba utilizando un proveedor de respaldo. Sin embargo, el agente alucinó dos veces: una vez al inventar un token de bot y otra al informar recuentos de errores inflados. Para contrarrestar esto, el equipo implementó un paso de verificación donde un modelo separado vuelve a contar los errores usando métodos diferentes, y establecieron un umbral de proporción estricto de 2.0 para rechazar alertas no verificadas. El agente inicialmente usó Claude Opus, pero volvió a MiniMax-M3 debido a la verbosidad y el alto costo de Opus. El agente consume aproximadamente 435 millones de tokens al mes con una suscripción de $10, y la mayoría de los tokens provienen de lecturas en caché. El equipo enfatiza la seguridad de la inyección de prompts, ya que los registros son entradas no confiables, pero el agente tiene acceso de solo lectura y envía solo a su propio canal de Telegram. En total, el sistema ha estado funcionando durante 135 días, con aproximadamente un mes de inactividad debido a varios problemas.
Fuente: Habr — хаб ИИ —
original
