Liquid AI ra mắt bộ mã hóa hai chiều mã nguồn mở LFM2.5-Encoder-230M và 350M
Liquid AI
Liquid AI vừa phát hành hai bộ mã hóa hai chiều mã nguồn mở, LFM2.5-Encoder-230M và 350M, được xây dựng trên nền tảng lai LFM2 với ngữ cảnh 8.192 token. Mô hình 350M đứng thứ tư trong số 14 mô hình trên 17 tác vụ, vượt trội hơn các mô hình lớn hơn như XLM-R XL. Cả hai bộ mã hóa đều được tối ưu hóa để triển khai trên CPU, trong đó mô hình 230M nhanh hơn đáng kể so với ModernBERT-base ở ngữ cảnh 8K.
Liquid AI phát hành hai bộ mã hóa song hướng trọng số mở, LFM2.5-Encoder-230M và LFM2.5-Encoder-350M, dựa trên nền tảng kết hợp LFM2. Cả hai đều hỗ trợ ngữ cảnh 8.192 token. Chúng được chuyển đổi từ nền tảng giải mã LFM2.5 bằng cách thay thế cơ chế chú ý nhân quả bằng song hướng, làm cho các tích chập ngắn trở nên phi nhân quả, và huấn luyện với mục tiêu mô hình hóa ngôn ngữ che giấu 30%. Quá trình huấn luyện gồm hai giai đoạn: năng lực ngôn ngữ tổng quát ở 1.024 token, sau đó mở rộng ngữ cảnh lên 8.192 token. Mô hình 350M đạt điểm trung bình 81,02 trên 17 nhiệm vụ, xếp thứ tư trong số 14 mô hình, sau XLM-R XL (3,5B), ModernBERT-large (395M) và XLM-R large (560M). Mô hình 230M đạt 79,29, vượt qua ModernBERT-base và tất cả các mô hình EuroBERT. Ở 8K token trên CPU, mô hình 230M thực hiện một lượt chuyển tiếp trong khoảng 28 giây so với hơn 90 giây của ModernBERT-base. Các bộ mã hóa này nhắm đến các thiết bị biên, hệ thống tại chỗ có quy định, và đường ống khối lượng lớn. Chúng được tải qua transformers với trust_remote_code=True và yêu cầu tinh chỉnh. Liquid AI cũng cung cấp năm bản demo chỉ dành cho CPU trên Hugging Face Spaces.
Nguồn: MarkTechPost —
bản gốc
