ModèlesMatériel et Inférence 🇺🇸 12.08.2026 18:02

LFM2.5-VL-3B : le nouveau modèle vision-langage de Liquid AI pour les appareils de périphérie

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Liquid AI a publié LFM2.5-VL-3B, un modèle vision-langage compact conçu pour une inférence efficace sur appareil. Il offre des améliorations dans la compréhension d'écran, l'ancrage, le raisonnement multi-image et l'appel de fonctions. Le modèle surpasse des concurrents de taille similaire sur de nombreux critères de référence tout en étant optimisé pour un déploiement sur processeur et carte graphique.
Liquid AI a annoncé la sortie de LFM2.5-VL-3B, un modèle de langage et de vision de 3,1 milliards de paramètres destiné aux appareils de périphérie. Il combine un encodeur visuel SigLIP2 400M NaFlex avec le socle texte LFM2.5-2.6B de l'entreprise et a été entraîné sur environ 34 000 milliards de jetons, avec quatre fois plus de données visuelles que les versions précédentes. Le modèle atteint des résultats de pointe dans sa catégorie de taille sur de nombreux benchmarks visuels, notamment la compréhension d'écran, l'ancrage et le raisonnement multi-images. Il montre également de bonnes performances dans des tâches purement textuelles telles que le suivi d'instructions et l'utilisation d'outils. LFM2.5-VL-3B est optimisé pour l'inférence sur appareil, atteignant 228 jetons par seconde sur un M5 Max et 116 jetons par seconde sur un Ryzen AI Max+ 395, et même 20 jetons par seconde sur un Galaxy S26 Ultra. Il prend en charge l'entrée multi-images avec une faible latence et un débit élevé sur GPU, atteignant environ 11 000 jetons de sortie par seconde en forte concurrence. Le modèle est disponible sur Hugging Face et compatible avec les principaux cadres d'inférence, notamment transformers, vLLM et llama.cpp.
Source: Hugging Face blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches