ModèlesAgents 🇺🇸 13.08.2026 19:06

Liquid AI dévoile LFM2.5-VL-3B : un modèle vision-langage compact pour la lecture d'écran, l'ancrage d'objets et l'appel d'outils sur appareil

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind
Liquid AI a publié LFM2.5-VL-3B, un modèle vision-langage de 3,1 milliards de paramètres destiné au déploiement sur appareil. Il excelle dans la lecture d'écrans numériques, l'ancrage d'objets et l'appel d'outils, atteignant une moyenne de 69,4 sur 28 références de vision, égalant des modèles plus grands. Le modèle tient dans environ 3 Go de mémoire et fonctionne efficacement sur le matériel d'Apple, avec une licence ouverte unique, gratuite pour les entreprises dont le chiffre d'affaires annuel est inférieur à 10 millions de dollars.
Liquid AI a annoncé la sortie de LFM2.5-VL-3B, un modèle vision-langage de 3,1 milliards de paramètres conçu pour un déploiement sur appareil. Le modèle lit les écrans numériques sur mobile, web et bureau, ancre des objets à des coordonnées, analyse des documents et des graphiques, et appelle des outils à partir de texte ou d'image en entrée. Il atteint une moyenne de 69,4 sur 28 benchmarks de vision, égalant InternVL-3.5-4B et se situant à 0,7 point derrière Qwen3.5-4B, qui sont tous deux des modèles de 4,7 milliards de paramètres. Le modèle n'est pas du type raisonnement afin de maintenir une faible latence, tient dans environ 3 Go de mémoire, et décode 228 jetons par seconde sur un Apple M5 Max. Le point de contrôle est disponible aux formats natif, GGUF, ONNX et MLX, avec une prise en charge dès le premier jour par llama.cpp, MLX, vLLM, SGLang et les environnements d'exécution ONNX. La licence ouverte LFM v1.0 est basée sur Apache-2.0, mais l'utilisation commerciale gratuite prend fin lorsque le chiffre d'affaires annuel d'une entreprise atteint 10 millions de dollars. Les améliorations clés par rapport à la version précédente incluent une moyenne ScreenSpot-v2 de 80,7, une augmentation de la précision@1 moyenne RefCOCO de 57,1 à 87,9, et de nouvelles capacités d'appel de fonctions avec des scores ToolSandbox passant de 26,4 à 59,5.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches