LFM2.5-VL-3B:Liquid AI 面向边缘设备的新视觉语言模型
Liquid AI
Google/DeepMind
Alibaba/Qwen
Liquid AI 发布了 LFM2.5-VL-3B,这是一款专为高效设备端推理而设计的紧凑型视觉语言模型。该模型在屏幕理解、基础定位、多图像推理和函数调用方面均有改进。在许多基准测试中,该模型性能优于同尺寸竞品,同时针对 CPU 和 GPU 部署进行了优化。
Liquid AI 宣布发布 LFM2.5-VL-3B,这是一款面向边缘设备的 3.1B 参数视觉语言模型。它将 SigLIP2 400M NaFlex 视觉编码器与该公司的 LFM2.5-2.6B 文本骨干网络相结合,并基于约 34 万亿个令牌进行训练,其中视觉数据量是之前版本的四倍。该模型在众多视觉基准测试中,其尺寸类别内达到了最先进的水平,包括屏幕理解、视觉定位和多图像推理。它在纯文本任务中也表现出色,如指令遵循和工具使用。LFM2.5-VL-3B 针对设备端推理进行了优化,在 M5 Max 上达到每秒 228 个令牌,在 Ryzen AI Max+ 395 上达到每秒 116 个令牌,甚至在 Galaxy S26 Ultra 上也能达到每秒 20 个令牌。它支持多帧输入,在 GPU 上具有低延迟和高吞吐量,在高并发下每秒可输出约 1.1 万个令牌。该模型已在 Hugging Face 上提供,并兼容包括 transformers、vLLM 和 llama.cpp 在内的主流推理框架。
来源: Hugging Face blog —
原文
