ModellenOpen Source 🇺🇸 28.07.2026 19:02

LFM2.5-Encoders: snelle CPU-inferentie voor lange contexten

Liquid AILiquid AI
Liquid AI heeft LFM2.5-Encoders uitgebracht, bidirectionele encodermodellen gebouwd op basis van LFM2.5-decoders. Ze ondersteunen een context van 8.192 tokens, behalen een 3,7× snelheidswinst ten opzichte van ModernBERT op CPU bij lange contexten, en presteren uitstekend op GLUE, SuperGLUE en meertalige taken.
Liquid AI heeft de release aangekondigd van LFM2.5-Encoders, twee algemene bidirectionele encodermodellen (230M en 350M parameters) die zijn geïnitialiseerd vanuit LFM2.5-decoderbackbones. Ze zijn voorgetraind met een gemaskeerde-taaldoelstelling (30% maskering) in twee fasen: korte context (1.024 tokens) op een grote webcorpus en aanpassing aan lange context (8.192 tokens) op een volledige datamix. Op benchmarks staat het 350M-model op de vierde plaats van 14 modellen en verslaat het grotere modellen tot 3,5 miljard parameters, terwijl het 230M-model beter presteert dan ModernBERT-base en alle EuroBERT-modellen. Inferentiesnelheidstests tonen aan dat LFM2.5-Encoder-230M de snelste is op CPU over alle sequentielengtes; bij 8.192 tokens verwerkt het een forward pass in ongeveer 28 seconden versus ongeveer 90 seconden voor ModernBERT-base (3,7× sneller). Op GPU leiden de encoders voor inputs boven ongeveer 2.000 tokens. De modellen hebben open gewichten op Hugging Face en ondersteunen finetuning voor classificatie, token-level taken en retrieval. Demo's omvatten zero-shot prompt routing, policy linting, spellingscontrole, PII-detectie en gemaskeerde-diffusie tekstgeneratie.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws