LFM2.5-VL-3B: Liquid AIs neues Vision-Language-Modell für Edge-Geräte
Liquid AI
Google/DeepMind
Alibaba/Qwen
Liquid AI hat LFM2.5-VL-3B veröffentlicht, ein kompaktes Vision-Language-Modell, das für effiziente Inferenz auf Geräten entwickelt wurde. Es bietet Verbesserungen beim Verständnis von Bildschirminhalten, bei der Grounding-Fähigkeit, beim Multi-Image-Reasoning und bei Funktionsaufrufen. Das Modell übertrifft ähnlich große Wettbewerber in vielen Benchmarks und ist für die Bereitstellung auf CPU und GPU optimiert.
Liquid AI hat die Veröffentlichung von LFM2.5-VL-3B angekündigt, einem Vision-Language-Modell mit 3,1 Milliarden Parametern für Edge-Geräte. Es kombiniert einen SigLIP2 400M NaFlex-Vision-Encoder mit dem Text-Backbone LFM2.5-2.6B des Unternehmens und wurde auf etwa 34 Billionen Tokens trainiert, wobei die Menge an Bilddaten viermal so hoch ist wie bei früheren Versionen. Das Modell erzielt in seiner Größenklasse Spitzenergebnisse bei vielen Vision-Benchmarks, darunter Bildschirmverständnis, Grounding und Multi-Bild-Schlussfolgerung. Es zeigt auch eine starke Leistung bei reinen Textaufgaben wie Anweisungsbefolgung und Werkzeugnutzung. LFM2.5-VL-3B ist für die Inferenz auf dem Gerät optimiert und erreicht 228 Tokens pro Sekunde auf einem M5 Max und 116 Tokens pro Sekunde auf einem Ryzen AI Max+ 395, und sogar 20 Tokens pro Sekunde auf einem Galaxy S26 Ultra. Es unterstützt Multi-Frame-Eingaben mit geringer Latenz und hohem Durchsatz auf GPUs und erreicht bei hoher Nebenläufigkeit etwa 11.000 Ausgabe-Tokens pro Sekunde. Das Modell ist auf Hugging Face verfügbar und mit wichtigen Inferenz-Frameworks wie Transformers, vLLM und llama.cpp kompatibel.
Quelle: Hugging Face blog —
Original
