Aracı yapay zeka için kurumsal ortamı oluşturmak
Intel Corporation
Anthropic
Intel, kurumsal düzeyde aracı yapay zeka dağıtan işletmeler için beş pratik ders paylaşıyor; başarının yalnızca büyük dil modeli çıkarımının ötesinde eksiksiz bir ortam gerektirdiğini ve vCPU başına aracı yoğunluğu ile yüzde 95 gecikme gibi metriklerin önemini vurguluyor. Makale, aracı yoğunluğuna göre planlama, yeni izlenebilirlik uygulamalarını benimseme ve varsayılan olarak ölçeklendirme olmak üzere üç aşamalı bir yaklaşımı özetliyor.
Intel, binlerce etmen tabanlı yapay zeka iş yükü deneyi gerçekleştirerek kurumsal liderler için beş ders çıkardı. Etmen tabanlı yapay zekanın yalnızca çıkarım değil, daha büyük bir sistem sorunu olduğunu ve mevcut araçların çoğunun genel sistem performansını ölçmediğini savunuyorlar. Kapasite, etmen sayısına değil, sanal CPU başına düşen etmen yoğunluğuna göre planlanmalıdır. Ortalama CPU kullanımından ziyade etmen görev gecikmesini (P95) izlemek daha bilgilendiricidir. Etmenleri barındıran sistemler varsayılan olarak yatay ölçeklendirmeli, etmen başına daha ağır hesaplama gerektiren iş yükleri için dikey ölçeklendirme ayrılmalıdır. Intel, etmen tabanlı yapay zeka iş yüklerini kıyaslamak için Terminal-Bench'i genişletti ve etmen performansını büyük dil modeli değişkenliğinden ayırmak amacıyla büyük dil modeli yanıtlarının deterministik kayıt-tekrarlama yöntemini kullandı. Görev karışımı derleme, test, veritabanı işlemleri ve daha fazlasını içeriyordu. Etmen tabanlı yapay zeka dağıtımı üç aşamada ilerlemelidir: etmen yoğunluğuna göre planlama, P95 gecikmesine odaklanan yeni gözlemlenebilirlik benimseme ve varsayılan olarak yatay ölçeklendirme. Makale ayrıca etmen tabanlı yapay zeka için kurumsal kullanıcı profillerini de belirliyor: çevrim süresini, üretkenliği ve maliyet yönetimini iyileştiren sorumlu liderler.
Kaynak: MIT Technology Review —
orijinal
