Liquid AI ra mắt LFM2.5-VL-3B: Mô hình ngôn ngữ thị giác nhỏ gọn để đọc màn hình, gắn kết đối tượng và gọi công cụ trên thiết bị
Liquid AI
Google/DeepMind
Liquid AI đã phát hành LFM2.5-VL-3B, một mô hình ngôn ngữ thị giác với 3,1 tỷ tham số dành cho triển khai trên thiết bị. Mô hình này vượt trội trong việc đọc màn hình kỹ thuật số, gắn kết đối tượng và gọi công cụ, đạt trung bình 69,4 điểm trên 28 tiêu chuẩn đánh giá thị giác, ngang bằng với các mô hình lớn hơn. Mô hình chiếm khoảng 3 GB bộ nhớ và chạy hiệu quả trên phần cứng Apple, với giấy phép mở độc đáo miễn phí cho các công ty có doanh thu hàng năm dưới 10 triệu đô la Mỹ.
Liquid AI đã công bố phát hành LFM2.5-VL-3B, một mô hình ngôn ngữ thị giác (vision-language) có 3,1 tỷ tham số, được thiết kế cho việc triển khai trên thiết bị. Mô hình này có thể đọc màn hình kỹ thuật số trên nền tảng di động, web và máy tính để bàn, xác định vị trí vật thể theo tọa độ, phân tích tài liệu và biểu đồ, cũng như gọi các công cụ từ đầu vào văn bản hoặc hình ảnh. Mô hình đạt trung bình 69,4 điểm trên 28 bài kiểm tra thị giác, tương đương với InternVL-3.5-4B và thấp hơn Qwen3.5-4B 0,7 điểm, trong khi cả hai mô hình này đều có 4,7 tỷ tham số. Mô hình không có khả năng suy luận (non-reasoning) để giảm độ trễ, chiếm khoảng 3 GB bộ nhớ và giải mã 228 token mỗi giây trên Apple M5 Max. Bản kiểm tra (checkpoint) có sẵn ở các định dạng native, GGUF, ONNX và MLX, với hỗ trợ ngay từ ngày đầu cho llama.cpp, MLX, vLLM, SGLang và các bộ chạy ONNX. Giấy phép LFM Open License v1.0 dựa trên Apache-2.0, nhưng việc sử dụng thương mại miễn phí chỉ áp dụng cho đến khi doanh thu hàng năm của công ty đạt 10 triệu đô la Mỹ. Các cải tiến chính so với phiên bản trước bao gồm điểm trung bình ScreenSpot-v2 đạt 80,7, độ chính xác@1 trung bình của RefCOCO tăng từ 57,1 lên 87,9, và khả năng gọi hàm mới với điểm ToolSandbox tăng từ 26,4 lên 59,5.
Nguồn: MarkTechPost —
bản gốc
