Kegagalan agen AI: mengapa dasbor hijau tetapi agen berbohong selama berhari-hari
Cloud.ru
Pemantauan klasik tidak menangkap kegagalan agen AI karena agen menurun secara bertahap, bukan crash. Untuk mendeteksi masalah, tim harus melacak siklus penalaran, mengukur metrik kualitas agenik, menggunakan evaluasi LLM-sebagai-hakim, membuat versi prompt, dan menulis telemetri ke dua tujuan sejak hari pertama.
Agen AI gagal dengan cara yang berbeda dari layanan tradisional: mereka tidak mogok tetapi menurun secara perlahan, sehingga metrik ketersediaan dan tingkat kesalahan standar menjadi tidak berguna. Agen membuat keputusan non-deterministik di setiap langkah, sehingga kegagalan terjadi dalam siklus penalaran, bukan pada respons akhir. Untuk mencapai keteramatan (observability), tim harus melacak seluruh siklus penalaran dengan ID pelacakan unik, mengukur metrik tingkat agen seperti akurasi pemilihan alat dan tingkat penyelesaian tujuan, mengevaluasi sampel respons menggunakan LLM-sebagai-hakim (LLM-as-judge), melakukan versi pada prompt di Git, dan menulis telemetri ke dua tujuan (misalnya, penyedia cloud dan alat khusus) untuk menghindari penguncian vendor (vendor lock-in). Praktik-praktik ini penting bahkan sebelum alat keteramatan agen khusus menjadi matang.
Sumber: Habr — хаб ИИ —
asli
