ModellerDonanım ve Çıkarım 🇺🇸 12.08.2026 18:02

LFM2.5-VL-3B: Liquid AI'nın Uç Cihazlar için Yeni Görüntü-Dil Modeli

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Liquid AI, verimli cihaz içi çıkarım için tasarlanmış kompakt bir görüntü-dil modeli olan LFM2.5-VL-3B'yi yayınladı. Model; ekran anlama, temellendirme, çoklu görüntü akıl yürütme ve fonksiyon çağırma alanlarında iyileştirmeler sunuyor. Model, CPU ve GPU dağıtımı için optimize edilmişken, birçok kıyaslamada benzer boyuttaki rakiplerinden daha iyi performans gösteriyor.
Liquid AI, uç cihazlar için tasarlanmış 3,1B parametreli görüntü-dil modeli LFM2.5-VL-3B'nin yayınlandığını duyurdu. Model, SigLIP2 400M NaFlex görüntü kodlayıcısını şirketin LFM2.5-2.6B metin omurgasıyla birleştiriyor ve önceki sürümlere kıyasla dört kat daha fazla görüntü verisiyle yaklaşık 34 trilyon token üzerinde eğitildi. Model, ekran anlama, grounding ve çoklu görüntü akıl yürütme dahil birçok görüntü benchmarkında kendi boyut sınıfında en son teknoloji sonuçlar elde ediyor. Ayrıca talimat takibi ve araç kullanımı gibi yalnızca metin içeren görevlerde de güçlü performans gösteriyor. LFM2.5-VL-3B, cihaz üzerinde çıkarım için optimize edilmiştir; M5 Max üzerinde saniyede 228 token, Ryzen AI Max+ 395 üzerinde saniyede 116 token ve hatta Galaxy S26 Ultra üzerinde saniyede 20 token hıza ulaşmaktadır. Model, GPU'larda düşük gecikme süresi ve yüksek verimlilikle çoklu kare girişini destekler; yüksek eşzamanlılıkta saniyede yaklaşık 11.000 çıktı tokenı elde eder. Model Hugging Face üzerinde mevcuttur ve transformers, vLLM ve llama.cpp dahil başlıca çıkarım çerçeveleriyle uyumludur.
Kaynak: Hugging Face blog — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler