ModèlesOpen Source 🇺🇸 28.07.2026 19:02

LFM2.5-Encoders : Inférence CPU rapide pour longs contextes

Liquid AILiquid AI
Liquid AI a publié les encodeurs LFM2.5, des modèles d'encodeurs bidirectionnels construits à partir des décodeurs LFM2.5. Ils prennent en charge un contexte de 8 192 tokens, offrent un gain de vitesse de 3,7 fois par rapport à ModernBERT sur CPU pour les longs contextes, et excellent sur les tâches GLUE, SuperGLUE et multilingues.
Liquid AI a annoncé la sortie des LFM2.5-Encoders, deux modèles encodeurs bidirectionnels généralistes (230M et 350M paramètres) initialisés à partir des backbones decodeurs LFM2.5. Ils sont pré-entraînés avec un objectif de langage masqué (masquage à 30 %) en deux étapes : un contexte court (1 024 tokens) sur un vaste corpus web, puis une adaptation au contexte long (8 192 tokens) sur l'ensemble complet des données. Sur les benchmarks, le modèle 350M se classe quatrième parmi 14 modèles, surpassant des modèles plus grands jusqu'à 3,5B, tandis que le modèle 230M surpasse ModernBERT-base et tous les modèles EuroBERT. Les tests de vitesse d'inférence montrent que le LFM2.5-Encoder-230M est le plus rapide sur CPU pour toutes les longueurs de séquence ; à 8 192 tokens, il effectue un passage avant en environ 28 secondes contre environ 90 secondes pour ModernBERT-base (3,7× plus rapide). Sur GPU, les encodeurs sont en tête pour les entrées au-dessus d'environ 2 000 tokens. Les modèles sont en open-weight sur Hugging Face et supportent le fine-tuning pour la classification, les tâches au niveau des tokens et la recherche. Les démonstrations incluent le routage zero-shot par prompt, la vérification de politique, la correction orthographique, la détection de PII (informations personnellement identifiables) et la génération de texte par diffusion masquée.
Source: Hugging Face blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches