Agen AI Otonom Memantau Log Produksi Selama 4 Bulan: 113 Peringatan, 2 Halusinasi, dan Perbaikan dalam 3,5 Jam
MiniMax
Anthropic
Seorang agen AI otonom telah memantau log produksi selama 84 hari, menghasilkan 113 peringatan, termasuk perbaikan kritis yang digabungkan dalam 3,5 jam. Meskipun ada dua kali model berhalusinasi, tim menerapkan langkah verifikasi untuk mengurangi peringatan palsu. Sistem ini menggunakan runtime yang dihosting sendiri, Grafana Loki, dan model AI yang hemat biaya untuk menjaga biaya tetap di bawah $10 per bulan.
Agen AI memantau log produksi untuk platform Creatorry, yang menghasilkan musik, foto, dan video menggunakan AI. Sistem ini terdiri dari 18 layanan, mencatat sekitar 300.000 baris setiap hari, di mana sekitar 12.500 di antaranya adalah kesalahan atau peringatan. Agen berjalan setiap 30 menit, mengkueri Loki untuk kesalahan terbaru, dan hanya mengirim peringatan ke Telegram jika mendeteksi masalah kritis atau lonjakan signifikan dalam tingkat kesalahan. Selama 84 hari, agen mengeluarkan 113 peringatan, dengan 69 kesalahan, 41 kritis, dan tiga entri awal yang kekurangan label tingkat keparahan. Peringatan yang paling berdampak mendeteksi kesalahan kritis pada awal 1 Juni, yang mengarah pada perbaikan yang digabungkan dalam 3,5 jam. Agen juga menangkap gelombang kesalahan 503 yang mengungkapkan bahwa penyedia cadangan tidak digunakan. Namun, agen berhalusinasi dua kali: sekali dengan menciptakan token bot dan lain kali dengan melaporkan jumlah kesalahan yang meningkat. Untuk mengatasinya, tim menerapkan langkah verifikasi di mana model terpisah menghitung ulang kesalahan menggunakan metode yang berbeda, dan mereka menetapkan rasio ambang batas ketat 2,0 untuk menolak peringatan yang tidak terverifikasi. Agen awalnya menggunakan Claude Opus tetapi beralih kembali ke MiniMax-M3 karena Opus yang bertele-tele dan biaya tinggi. Agen mengonsumsi sekitar 435 juta token per bulan dengan langganan $10, dengan sebagian besar token berasal dari pembacaan cache. Tim menekankan keamanan injeksi prompt, karena log adalah input yang tidak tepercaya, tetapi agen memiliki akses hanya-baca dan mengirim ke saluran Telegram mereka sendiri saja. Secara total, sistem telah berjalan selama 135 hari, dengan sekitar satu bulan waktu henti karena berbagai masalah.
Sumber: Habr — хаб ИИ —
asli
