ModelosCódigo Aberto 🇺🇸 28.07.2026 19:02

LFM2.5-Encoders: Inferência Rápida em CPU com Contexto Longo

Liquid AILiquid AI
A Liquid AI lançou os LFM2.5-Encoders, modelos de codificador bidirecional construídos a partir dos decodificadores LFM2.5. Eles suportam contexto de 8.192 tokens, alcançam aceleração de 3,7 vezes em relação ao ModernBERT em CPU com contexto longo e se destacam em tarefas GLUE, SuperGLUE e multilíngues.
A Liquid AI anunciou o lançamento do LFM2.5-Encoders, dois modelos codificadores bidirecionais de uso geral (230M e 350M parâmetros) inicializados a partir das bases decodificadoras LFM2.5. Eles são pré-treinados com um objetivo de linguagem mascarada (30% de máscara) em dois estágios: contexto curto (1.024 tokens) em um grande corpus da web e adaptação de contexto longo (8.192 tokens) em uma mistura completa de dados. Em benchmarks, o modelo de 350M ficou em quarto lugar entre 14 modelos, superando modelos maiores de até 3,5B, enquanto o modelo de 230M supera o ModernBERT-base e todos os modelos EuroBERT. Testes de velocidade de inferência mostram que o LFM2.5-Encoder-230M é o mais rápido em CPU em todos os comprimentos de sequência; a 8.192 tokens, ele processa uma passagem direta em ~28 segundos, contra ~90 segundos do ModernBERT-base (3,7× mais rápido). Em GPU, os codificadores lideram para entradas acima de ~2.000 tokens. Os modelos têm pesos abertos no Hugging Face e suportam ajuste fino para classificação, tarefas no nível do token e recuperação. As demonstrações incluem roteamento de prompt zero-shot, linting de políticas, verificação ortográfica, detecção de PII (Informações Pessoais Identificáveis) e geração de texto por difusão mascarada.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas