Neden Bir Yapay Zeka Aracısı Aslında RAG'den Daha Ucuz
Klasik bir RAG asistanı sorgu başına daha ucuz görünse de, kullanıcı takipleri ve operatör yönlendirmeleri gibi gizli maliyetler onu genel olarak daha pahalı hale getirir. Bir ReAct döngüsü kullanan bir aracı, tam yanıtı bulana kadar birden fazla belgeyi otonom olarak tarar ve 3 denemelik 27 dakikalık bir süreci tek bir 4 dakikalık yanıta dönüştürür. Bir destek projesinden alınan gerçek pilot verileri, aracıların soruları bir RAG asistanının maliyetinin üçte biri kadar kapattığını doğrulamaktadır.
Makale, bir RAG asistanı ile bir ajan arasındaki naif maliyet karşılaştırmasının yanıltıcı olduğunu savunuyor. Klasik bir RAG asistanı tek bir LLM çağrısı yapar ve cevap yanlışsa kullanıcının sorguyu iyileştirmesine güvenir. Pratikte kullanıcılar genellikle 2-3 denemeden sonra vazgeçer ve durumu insan operatöre yükseltir, operatör de vakayı çözmek için 10-15 dakika harcar. Bu, tek bir LLM çağrısından çok daha fazlasına denk gelir. ReAct döngüsüne dayalı bir ajan, kullanıcı müdahalesi olmadan arama araçları üzerinde otonom olarak yinelenir, hipotez kurar, parçaları alır ve nihai bir cevap sentezler. Yazarın ISTOK ajanı beş araç kullanır: VectorSearch (Milvus aracılığıyla hibrit dense-BM25), Search (PostgreSQL tam metin), OpenChunk (tüm belge parçalarını okumak için), GetDocumentChunks (içindekiler tablosu için) ve CallOperator (2-3 kendi denemesinden sonra son çare). Bağlam penceresi sınırlamalarını yönetmek için ajan önce LLM özetlemesini denedi ancak bunu pahalı ve güvenilmez buldu; şimdi bir kayan pencere (son 6 mesajı tut, en eski araç mesajlarını at) kullanıyor ve özetlemeyi yedek olarak (oturum başına en fazla 2) uyguluyor. LLM çağrıları da farklılaştırılmıştır: ucuz gömme ve yeniden sıralama, basit adımlar için hafif oluşturma, tipik akıl yürütme için orta ve yalnızca nihai sentez veya özetleme için ağır. Gerçek bir pilotta, yaklaşık 1200 belge ve aylık 1800 talep ile asistan ortalama 1 LLM çağrısı, 2.3 kullanıcı takibi, %34 yükseltme oranı, kapanış için 27 dakika ve kapalı soru başına ~18.000 token sağladı. Ajan ise ortalama 6.4 LLM çağrısı, 0.3 takip, %11 yükseltme, kapanış için 4 dakika ve ~15.500 token sağladı. Doğrudan maliyette, asistanın kapalı soru maliyeti ~52 RUB (operatör maliyeti dahil) iken, ajanın maliyeti ~17 RUB idi ve bu üç kat azalma anlamına geliyor. Ajanın avantajı, basit gerçek sorularında veya bilgi tabanı boş olduğunda kaybolur çünkü gereksiz yinelemeler yapar. Ajan, her çağrının token kullanımını ve araç geçmişini kaydeder ve ayrıntılı yineleme dökümü için Arize Phoenix ile izleme yapar.
Kaynak: Habr — хаб ИИ —
orijinal
