Altyapı LLM ajanına yalan söylememeyi öğretmek
DeepSeek
Altyapı olay incelemeleri için salt okunur bir yapay zeka ajanı oluşturuldu. Başlangıçta makul ancak işe yaramaz yanıtlar veriyordu. Ekip, sorunu LLM'yi uygulamanın içine taşıyarak, araç sözleşmeleri, kanıt koruyucuları ve yapılandırılmış planlama ekleyerek çözdü. Son çalıştırmada 45 test senaryosundan 44'ü başarılı oldu.
Dahili salt okunur bir LLM aracısı, 'hizmet neden 502 dönüyor?' gibi altyapı sorularını yanıtlamak için oluşturuldu. Go kullanıldı, LangChain kullanılmadı ve DeepSeek-V4-Flash ile Qwen3.6-27B-FP8 modellerine OpenAI uyumlu API üzerinden çağrı yapıldı. İlk sürüm, ücretsiz bir ReAct döngüsü kullandı ve biçimsel olarak doğru ancak çoğu zaman yanıltıcı yanıtlar üretti. Örneğin, bir 502 hatası, proxy'de aşırı büyük bir yanıt başlığından kaynaklandığında, aracı 'uygulama düzeyinde hata yok' sonucuna vararak gerçek nedeni kaçırdı. Beş hata sınıfı belirlendi: yanlış kapsam, yanlış zaman anlambilimi, yanlış olumsuz çıkarımlar, kanıt kaybı ve kontrolsüz yeniden planlama. Çözüm, LLM'yi katı bir uygulama çerçevesi içine yerleştirmek oldu. Araç çağrıları, kanıt, çıktı türü, tazelik, olumsuz anlambilim ve salt okunur durumu tanımlayan genişletilmiş bir x-agent sözleşmesi tarafından yönetilir. Planlayıcı önce hedefler (ör. symptom.http_502, route.edge_to_ingress) ve bir durdurma koşulu oluşturur: gerekli her hedef çözülmeli veya açıkça kullanılamaz olmalıdır. Bir kanıt koruyucusu, tüm hedefler karşılanana kadar sonlandırıcının sonuçlandırmasını engeller. Araç seçimi aşamalıdır: politika filtresi, sözcüksel ön filtre, LLM yeniden sıralama (ilk 8) ve ardından hedef uygunluk kapısı. Riskli amaçlar için deterministik ön yollar vardır. Son değerlendirmede, 45 senaryodan 44'ü geçti (29'u zorunlu, her biri iki kez çalıştırıldı). Başarısız olan tek test, isteğe bağlı bir kapasite raporu biçimiydi. Aracı salt okunur kalır; üretim değişikliklerine insanlar karar verir.
Kaynak: Habr — хаб ИИ —
orijinal
