Autonome AI-agent bewaakt productielogs gedurende 4 maanden: 113 meldingen, 2 hallucinaties en een fix in 3,5 uur
MiniMax
Anthropic
Een autonome AI-agent bewaakt al 84 dagen productielogs en heeft 113 meldingen gegenereerd, waaronder een kritieke fix die in 3,5 uur werd gemerged. Ondanks twee gevallen waarin het model hallucineerde, heeft het team verificatiestappen geïmplementeerd om valse meldingen te verminderen. Het systeem gebruikt een zelf gehoste runtime, Grafana Loki en een kosteneffectief AI-model om de kosten onder de 10 dollar per maand te houden.
De AI-agent monitort productielogs voor het Creatorry-platform, dat met AI muziek, foto's en video's genereert. Het systeem omvat 18 services en logt dagelijks ongeveer 300.000 regels, waarvan ongeveer 12.500 fouten of waarschuwingen zijn. De agent draait elke 30 minuten, vraagt Loki op voor recente fouten en stuurt alleen meldingen naar Telegram als er kritieke problemen of een significante piek in foutpercentages worden gedetecteerd. In 84 dagen tijd heeft de agent 113 meldingen afgegeven, met 69 fouten, 41 kritieke fouten en drie vroege vermeldingen zonder ernstclassificatie. De meest impactvolle melding detecteerde een kritieke fout vroeg op 1 juni, wat leidde tot een fix die binnen 3,5 uur werd samengevoegd. De agent ontdekte ook een golf van 503-fouten die onthulde dat een fallback-provider niet werd gebruikt. De agent hallucineerde echter twee keer: een keer door een bot-token te verzinnen en een andere keer door opgeblazen foutaantallen te rapporteren. Om dit tegen te gaan, implementeerde het team een verificatiestap waarbij een apart model de fouten opnieuw telt met verschillende methoden, en ze stelden een strikte ratio-drempel van 2,0 in om ongeverifieerde meldingen af te wijzen. De agent gebruikte aanvankelijk Claude Opus, maar schakelde terug naar MiniMax-M3 vanwege de breedsprakigheid en hoge kosten van Opus. De agent verbruikt ongeveer 435 miljoen tokens per maand op een abonnement van $10, waarbij de meeste tokens afkomstig zijn van gecachte reads. Het team benadrukt de veiligheid van prompt-injectie, omdat logs onbetrouwbare invoer zijn, maar de agent heeft alleen leestoegang en stuurt alleen naar hun eigen Telegram-kanaal. In totaal draait het systeem al 135 dagen, met ongeveer een maand stilstand vanwege diverse problemen.
Bron: Habr — хаб ИИ —
origineel
