ModelAgen 🇺🇸 13.08.2026 19:06

Liquid AI Meluncurkan LFM2.5-VL-3B: Model Visi-Bahasa Kompak untuk Pembacaan Layar, Penandaan Objek, dan Pemanggilan Alat di Perangkat

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind
Liquid AI telah merilis LFM2.5-VL-3B, model visi-bahasa dengan parameter 3,1 miliar untuk penerapan di perangkat. Model ini unggul dalam membaca layar digital, menandai objek, dan memanggil alat, mencapai rata-rata 69,4 pada 28 tolok ukur visi, setara dengan model yang lebih besar. Model ini hanya membutuhkan sekitar 3 GB memori dan berjalan efisien di perangkat keras Apple, dengan lisensi terbuka yang unik yang gratis untuk perusahaan dengan pendapatan tahunan di bawah 10 juta dolar AS.
Liquid AI mengumumkan rilis LFM2.5-VL-3B, model visi-bahasa dengan 3,1 miliar parameter yang dirancang untuk penerapan di perangkat. Model ini membaca layar digital di perangkat seluler, web, dan desktop, menandai objek ke koordinat, mengurai dokumen dan grafik, serta memanggil alat dari input teks atau gambar. Model ini mencapai rata-rata 69,4 pada 28 tolok ukur visi, setara dengan InternVL-3.5-4B dan hanya 0,7 poin di belakang Qwen3.5-4B, yang keduanya merupakan model 4,7 miliar parameter. Model ini tidak menggunakan penalaran (non-reasoning) untuk menjaga latensi tetap rendah, hanya membutuhkan sekitar 3 GB memori, dan mendekode 228 token per detik pada Apple M5 Max. Checkpoint tersedia dalam format asli (native), GGUF, ONNX, dan MLX, dengan dukungan hari pertama untuk llama.cpp, MLX, vLLM, SGLang, dan runtime ONNX. Lisensi Terbuka LFM v1.0 berbasis Apache-2.0, tetapi penggunaan komersial gratis berakhir ketika pendapatan tahunan perusahaan mencapai $10 juta. Peningkatan utama dibandingkan versi sebelumnya mencakup rata-rata ScreenSpot-v2 sebesar 80,7, peningkatan presisi@1 rata-rata RefCOCO dari 57,1 menjadi 87,9, dan kemampuan pemanggilan fungsi baru dengan skor ToolSandbox yang meningkat dari 26,4 menjadi 59,5.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru