Liquid AI brengt open-gewicht bidirectionele encoders LFM2.5-Encoder-230M en 350M uit
Liquid AI
Liquid AI heeft twee open-gewicht bidirectionele encoders uitgebracht, LFM2.5-Encoder-230M en 350M, gebouwd op de LFM2 hybride backbone met een context van 8.192 tokens. Het 350M-model staat op de vierde plaats van 14 modellen bij 17 taken en presteert beter dan grotere modellen zoals XLM-R XL. Beide encoders zijn geoptimaliseerd voor CPU-implementatie, waarbij het 230M-model aanzienlijk sneller is dan ModernBERT-base bij een context van 8K.
Liquid AI heeft twee open-weight bidirectionele encoders uitgebracht, LFM2.5-Encoder-230M en LFM2.5-Encoder-350M, gebaseerd op de LFM2 hybride backbone. Beide ondersteunen een context van 8.192 tokens. Ze zijn geconverteerd van LFM2.5 decoder backbones door causale aandacht te vervangen door bidirectionele aandacht, korte convoluties niet-causaal te maken en te trainen met een 30% gemaskeerde taalmodelleringsdoelstelling. De training had twee fasen: algemene taalvaardigheid bij 1.024 tokens, gevolgd door contextuitbreiding naar 8.192 tokens. Het 350M-model behaalde een gemiddelde van 81,02 over 17 taken, waarmee het op de vierde plaats eindigde van 14 modellen, achter XLM-R XL (3.5B), ModernBERT-large (395M) en XLM-R large (560M). Het 230M-model behaalde 79,29, waarmee het ModernBERT-base en alle EuroBERT-modellen overtrof. Bij 8.000 tokens op CPU voert het 230M-model één forward pass uit in ongeveer 28 seconden, tegenover meer dan 90 seconden voor ModernBERT-base. De encoders zijn bedoeld voor edge-apparaten, gereguleerde on-premise systemen en pijplijnen met hoog volume. Ze worden geladen via transformers met trust_remote_code=True en vereisen fine-tuning. Liquid AI heeft ook vijf CPU-only demo's aangeboden op Hugging Face Spaces.
Bron: MarkTechPost —
origineel
