Liquid AI publie les encodeurs bidirectionnels open-weight LFM2.5-Encoder-230M et 350M
Liquid AI
Liquid AI a publié deux encodeurs bidirectionnels open-weight, LFM2.5-Encoder-230M et 350M, construits sur le backbone hybride LFM2 avec un contexte de 8 192 tokens. Le modèle 350M se classe quatrième parmi 14 modèles sur 17 tâches, surpassant des modèles plus grands comme XLM-R XL. Les deux encodeurs sont optimisés pour le déploiement sur CPU, le modèle 230M étant nettement plus rapide que ModernBERT-base avec un contexte de 8K.
Liquid AI a publié deux encodeurs bidirectionnels à poids ouverts, LFM2.5-Encoder-230M et LFM2.5-Encoder-350M, basés sur le backbone hybride LFM2. Les deux prennent en charge un contexte de 8 192 tokens. Ils sont convertis à partir des backbones décodeurs LFM2.5 en remplaçant l'attention causale par une attention bidirectionnelle, en rendant les convolutions courtes non causales, et en s'entraînant avec un objectif de modélisation de langage masqué à 30 %. L'entraînement s'est déroulé en deux étapes : une compétence linguistique générale à 1 024 tokens, puis une extension du contexte à 8 192 tokens. Le modèle 350M a atteint une moyenne de 81,02 sur 17 tâches, se classant quatrième parmi 14 modèles, derrière XLM-R XL (3,5B), ModernBERT-large (395M) et XLM-R large (560M). Le modèle 230M a obtenu 79,29, surpassant ModernBERT-base et tous les modèles EuroBERT. À 8K tokens sur CPU, le modèle 230M exécute une passe avant en environ 28 secondes contre plus de 90 secondes pour ModernBERT-base. Les encodeurs sont destinés aux appareils de périphérie, aux systèmes sur site réglementés et aux pipelines à volume élevé. Ils se chargent via transformers avec trust_remote_code=True et nécessitent un réglage fin. Liquid AI a également fourni cinq démos uniquement CPU sur Hugging Face Spaces.
Source: MarkTechPost —
original
