Liquid AI esittelee LFM2.5-VL-3B:n: Kompakti näkö-kielimalli laitteen näytön lukemiseen, objektien paikantamiseen ja työkalujen kutsumiseen
Liquid AI
Google/DeepMind
Liquid AI on julkaissut LFM2.5-VL-3B:n, 3,1 miljardin parametrin näkö-kielimallin, joka on suunniteltu laitteessa tapahtuvaan käyttöön. Se loistaa digitaalisten näyttöjen lukemisessa, objektien paikantamisessa ja työkalujen kutsumisessa, saavuttaen keskimäärin 69,4 pistettä 28 näkötehtävässä, mikä vastaa suurempien mallien tasoa. Malli mahtuu noin 3 gigatavuun muistia ja toimii tehokkaasti Applen laitteistoilla, ja sen ainutlaatuinen avoin lisenssi on ilmainen yrityksille, joiden vuosiliikevaihto on alle 10 miljoonaa dollaria.
Liquid AI on ilmoittanut julkaisseensa LFM2.5-VL-3B:n, 3,1 miljardin parametrin vision-kielimallin, joka on suunniteltu laitteella ajettavaan käyttöön. Malli lukee digitaalisia näyttöjä mobiili-, verkko- ja työpöytäympäristöissä, paikantaa objektit koordinaatteihin, jäsentää asiakirjoja ja kaavioita sekä kutsuu työkaluja teksti- tai kuvasyötteen perusteella. Se saavuttaa keskimäärin 69,4 pistettä 28 vision-vertailutestissä, mikä vastaa InternVL-3.5-4B:tä ja on 0,7 pistettä Qwen3.5-4B:tä jäljessä; molemmat näistä ovat 4,7 miljardin parametrin malleja. Malli ei ole päättelyyn perustuva, jotta latenssi pysyy alhaisena, se mahtuu noin 3 gigatavuun muistia ja purkaa 228 tokenia sekunnissa Apple M5 Max -suorittimella. Tarkistuspiste on saatavilla natiivina, GGUF-, ONNX- ja MLX-muodoissa, ja ensimmäisen päivän tuki on llama.cpp-, MLX-, vLLM-, SGLang- ja ONNX-runtimeille. LFM Open License v1.0 perustuu Apache-2.0:aan, mutta ilmainen kaupallinen käyttö päättyy, kun yrityksen vuosittainen liikevaihto saavuttaa 10 miljoonaa dollaria. Tärkeimpiä parannuksia edelliseen versioon verrattuna ovat ScreenSpot-v2-keskiarvo 80,7, RefCOCO-keskiarvon tarkkuuden nousu@1 57,1:stä 87,9:ään ja uudet toimintojen kutsuntoiminnot, joiden ToolSandbox-pisteet paranevat 26,4:stä 59,5:een.
Lähde: MarkTechPost —
Alkuperäinen
