Liquid AI, LFM2.5-VL-3B Modelini Tanıttı: Cihaz Üzerinde Ekran Okuma, Nesne Konumlandırma ve Araç Çağırma için Kompakt Görsel-Dil Modeli
Liquid AI
Google/DeepMind
Liquid AI, cihaz üzerinde dağıtım için 3,1 milyar parametreli görsel-dil modeli LFM2.5-VL-3B'yi yayınladı. Model, dijital ekranları okuma, nesneleri konumlandırma ve araçları çağırma konularında başarılı olup, 28 görsel kıyaslama testinde ortalama 69,4 puan alarak daha büyük modellerle eşleşiyor. Model yaklaşık 3 gigabayt bellek kaplıyor ve Apple donanımında verimli bir şekilde çalışıyor; yıllık geliri 10 milyon ABD dolarının altında olan şirketler için ücretsiz olan benzersiz bir açık lisansa sahip.
Liquid AI, cihaz üzerinde dağıtım için tasarlanmış 3,1 milyar parametreli bir görüş-dil modeli olan LFM2.5-VL-3B'nin yayınlandığını duyurdu. Model, mobil, web ve masaüstü ortamlarındaki dijital ekranları okur, nesneleri koordinatlara göre konumlandırır, belgeleri ve çizelgeleri ayrıştırır ve metin veya görüntü girdisinden araç çağrıları yapar. 28 görüş kıyaslamasında ortalama 69,4 puan alarak InternVL-3.5-4B ile eşleşiyor ve her ikisi de 4,7 milyar parametreli olan Qwen3.5-4B'nin 0,7 puan gerisinde kalıyor. Model, düşük gecikme süresini korumak için akıl yürütme yapmıyor, yaklaşık 3 GB belleğe sığıyor ve Apple M5 Max üzerinde saniyede 228 token ayrıştırıyor. Kontrol noktası; yerel, GGUF, ONNX ve MLX formatlarında sunuluyor ve llama.cpp, MLX, vLLM, SGLang ve ONNX çalışma zamanları için ilk gün desteği sunuyor. LFM Açık Lisans v1.0, Apache-2.0 tabanlıdır ancak bir şirketin yıllık geliri 10 milyon ABD dolarına ulaştığında ücretsiz ticari kullanım sona erer. Önceki sürüme göre önemli iyileştirmeler arasında ScreenSpot-v2 ortalamasının 80,7 olması, RefCOCO-ortalama hassasiyet@1 değerinin 57,1'den 87,9'a çıkması ve ToolSandbox puanlarının 26,4'ten 59,5'e yükselmesiyle yeni işlev çağırma yetenekleri yer alıyor.
Kaynak: MarkTechPost —
orijinal
