Liquid AI, Açık Ağırlıklı Çift Yönlü Kodlayıcılar LFM2.5-Encoder-230M ve 350M'yi Yayımladı
Liquid AI
Liquid AI, LFM2 hibrit omurgası üzerine inşa edilmiş ve 8.192 token bağlamına sahip iki açık ağırlıklı çift yönlü kodlayıcı olan LFM2.5-Encoder-230M ve 350M'yi yayımladı. 350M modeli, 17 görevde 14 model arasında dördüncü sırada yer alarak XLM-R XL gibi daha büyük modelleri geride bırakıyor. Her iki kodlayıcı da CPU dağıtımı için optimize edilmiştir ve 230M modeli, 8K bağlamda ModernBERT-base'den önemli ölçüde daha hızlıdır.
Liquid AI, LFM2 hibrit omurgasını temel alan iki adet açık ağırlıklı çift yönlü kodlayıcıyı, LFM2.5-Encoder-230M ve LFM2.5-Encoder-350M'yi yayınladı. Her ikisi de 8.192 token bağlamını destekliyor. Bu kodlayıcılar, nedensel dikkati çift yönlü olarak değiştirerek, kısa evrişimleri nedensel olmayan hale getirerek ve %30 maskelenmiş dil modelleme hedefi ile eğitilerek LFM2.5 çözücü omurgalarından dönüştürüldü. Eğitim iki aşamadan oluşuyordu: önce 1.024 tokende genel dil yeterliliği, ardından bağlamın 8.192 tokene genişletilmesi. 350M modeli 17 görev ortalamasında 81,02 değerine ulaştı ve 14 model arasında XLM-R XL (3.5B), ModernBERT-large (395M) ve XLM-R large (560M) modellerinin ardından dördüncü sırada yer aldı. 230M modeli ise 79,29 değerine ulaşarak ModernBERT-base ve tüm EuroBERT modellerini geride bıraktı. CPU üzerinde 8K tokende, 230M modeli bir ileri geçişi yaklaşık 28 saniyede tamamlarken, ModernBERT-base için bu süre 90 saniyenin üzerindeydi. Kodlayıcılar, uç cihazlar, düzenlemeye tabi şirket içi sistemler ve yüksek hacimli işlem hatları için tasarlanmıştır. trust_remote_code=True ile dönüştürücüler üzerinden yüklenirler ve ince ayar gerektirirler. Liquid AI ayrıca Hugging Face Spaces üzerinde beş adet yalnızca CPU'ya özel demo yayınladı.
Kaynak: MarkTechPost —
orijinal
