Mô hìnhPhần cứng & Suy luận 🇺🇸 12.08.2026 18:02

LFM2.5-VL-3B: Mô Hình Ngôn Ngữ Thị Giác Mới Của Liquid AI Cho Thiết Bị Biên

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Liquid AI đã phát hành LFM2.5-VL-3B, một mô hình ngôn ngữ thị giác nhỏ gọn được thiết kế để suy luận hiệu quả trên thiết bị. Mô hình này cải thiện khả năng hiểu màn hình, định vị đối tượng, suy luận đa hình ảnh và gọi hàm. Mô hình vượt trội hơn các đối thủ cùng kích thước trên nhiều tiêu chuẩn đánh giá trong khi được tối ưu hóa để triển khai trên CPU và GPU.
Liquid AI đã công bố phát hành LFM2.5-VL-3B, một mô hình ngôn ngữ-thị giác có 3,1 tỷ tham số dành cho các thiết bị biên. Mô hình này kết hợp bộ mã hóa thị giác SigLIP2 400M NaFlex với phần lõi văn bản LFM2.5-2.6B của công ty và được huấn luyện trên khoảng 34 nghìn tỷ token, với lượng dữ liệu thị giác gấp bốn lần so với các phiên bản trước. Mô hình đạt được kết quả tiên tiến nhất trong phân khúc kích thước của nó trên nhiều tiêu chuẩn đánh giá thị giác, bao gồm hiểu màn hình, neo (grounding) và suy luận đa hình ảnh. Mô hình cũng thể hiện hiệu suất mạnh mẽ trong các tác vụ chỉ với văn bản như làm theo hướng dẫn và sử dụng công cụ. LFM2.5-VL-3B được tối ưu hóa cho suy luận trên thiết bị, đạt 228 token mỗi giây trên M5 Max và 116 token mỗi giây trên Ryzen AI Max+ 395, thậm chí đạt 20 token mỗi giây trên Galaxy S26 Ultra. Mô hình hỗ trợ đầu vào đa khung hình với độ trễ thấp và thông lượng cao trên GPU, đạt khoảng 11 nghìn token đầu ra mỗi giây ở mức đồng thời cao. Mô hình có sẵn trên Hugging Face và tương thích với các khung suy luận chính bao gồm Transformers, vLLM và llama.cpp.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới