LFM2.5-Encoders: Suy luận CPU nhanh với ngữ cảnh dài
Liquid AI
Liquid AI đã phát hành LFM2.5-Encoders, các mô hình mã hóa hai chiều được xây dựng từ bộ giải mã LFM2.5. Chúng hỗ trợ ngữ cảnh lên đến 8.192 token, đạt tốc độ nhanh hơn 3,7 lần so với ModernBERT trên CPU khi xử lý ngữ cảnh dài, và vượt trội trên các tác vụ GLUE, SuperGLUE và đa ngôn ngữ.
Liquid AI công bố phát hành LFM2.5-Encoders, hai mô hình encoder hai chiều đa năng (230 triệu và 350 triệu tham số) được khởi tạo từ các backbone decoder LFM2.5. Chúng được huấn luyện trước với mục tiêu ngôn ngữ có mặt nạ (masking 30%) qua hai giai đoạn: ngữ cảnh ngắn (1.024 token) trên một kho ngữ liệu web lớn và thích ứng ngữ cảnh dài (8.192 token) trên toàn bộ hỗn hợp dữ liệu. Trên các điểm chuẩn, mô hình 350 triệu tham số xếp thứ tư trong số 14 mô hình, vượt qua các mô hình lớn hơn lên đến 3,5 tỷ tham số, trong khi mô hình 230 triệu tham số vượt trội hơn ModernBERT-base và tất cả các mô hình EuroBERT. Các bài kiểm tra tốc độ suy luận cho thấy LFM2.5-Encoder-230M là nhanh nhất trên CPU ở mọi độ dài chuỗi; ở 8.192 token, nó xử lý một lượt truyền xuôi trong khoảng 28 giây, so với khoảng 90 giây của ModernBERT-base (nhanh hơn 3,7 lần). Trên GPU, các encoder dẫn đầu đối với đầu vào trên khoảng 2.000 token. Các mô hình có trọng số mở trên Hugging Face và hỗ trợ tinh chỉnh cho phân loại, tác vụ cấp token và truy xuất. Các bản demo bao gồm định tuyến prompt không cần huấn luyện (zero-shot), kiểm tra chính sách, kiểm tra chính tả, phát hiện thông tin nhận dạng cá nhân (PII) và sinh văn bản khuếch tán có mặt nạ.
Nguồn: Hugging Face blog —
bản gốc
