ScarfBench: Kurumsal Java Çerçeve Göçünde Yapay Zeka Ajanlarını Değerlendirmek İçin Bir Kıyaslama
IBM
Anthropic
ScarfBench, Kurumsal Java'da çerçeveler arası göç görevlerinde yapay zeka ajanlarını değerlendirmek için açık bir kıyaslamadır. Spring, Jakarta EE ve Quarkus'u kapsar. Göç ettirilen uygulamaların derlenip derlenmediğini, dağıtılıp dağıtılmadığını ve davranışı koruyup korumadığını test eder. Mevcut ajanlar aşırı özgüven gösterir ve çevre sorunlarıyla mücadele eder; yapılandırma göç çabasına hakimdir.
ScarfBench (Kendi Kendine Yeten Uygulama Dönüştürme Karşılaştırması), IBM Research tarafından yapay zeka aracılarını kurumsal Java çerçeve geçiş görevlerinde (Spring, Jakarta EE ve Quarkus kapsayan) değerlendirmek için tanıtılan açık bir karşılaştırmadır. Geleneksel karşılaştırmaların referans uygulamalara karşı üretilen kodu karşılaştırmasının aksine, ScarfBench dönüştürülen uygulamaların gerçekten derlenip, dağıtılıp ve davranışı koruyup korumadığını değerlendirir. Son teknoloji kodlama aracılarının değerlendirmeleri, derleme başarısının sürekli olarak dağıtım başarısını, dağıtım başarısının da davranışsal başarıyı aştığını ve yalnızca derleme başarısının geçiş kalitesini olduğundan fazla tahmin ettiğini göstermiştir. Aracıların aşırı güvenli olduğu bulunmuştur: Claude Code, 30 uygulamanın 29'unda başarılı derleme bildirdi, ancak yalnızca 22'si gerçekten başarılı bir şekilde derlendi. Karşılaştırma, çerçeve geçişinin yinelemeli olduğunu, yapılandırma katmanlarının çabaya hakim olduğunu ve ortam sorunlarının (Docker önbelleği, bağlantı noktası bağlantısı, Maven sarmalayıcı) sık sık doğrulama gecikmelerine neden olduğunu ortaya koymaktadır. Başarısız geçişler; derleme sistemleri, dağıtım ortamları, bağımlılık enjeksiyonu, veritabanları, uç noktalar, iddialar ve altyapıyı kapsamaktadır.
Kaynak: Hugging Face blog —
orijinal
