ModelosHardware e Inferência 🇺🇸 12.08.2026 18:02

LFM2.5-VL-3B: Novo modelo de visão-linguagem da Liquid AI para dispositivos de borda

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
A Liquid AI lançou o LFM2.5-VL-3B, um modelo compacto de visão-linguagem projetado para inferência eficiente em dispositivos. Ele oferece melhorias na compreensão de telas, grounding, raciocínio com múltiplas imagens e chamada de funções. O modelo supera concorrentes de tamanho similar em muitos benchmarks, sendo otimizado para implantação em CPU e GPU.
A Liquid AI anunciou o lançamento do LFM2.5-VL-3B, um modelo de linguagem-visão de 3,1 bilhões de parâmetros para dispositivos de borda. Ele combina um codificador de visão SigLIP2 400M NaFlex com o backbone de texto LFM2.5-2.6B da empresa e foi treinado em aproximadamente 34 trilhões de tokens, com quatro vezes mais dados de visão do que as versões anteriores. O modelo alcança resultados de ponta em sua classe de tamanho em muitos benchmarks de visão, incluindo compreensão de tela, groundedness (fundamentação) e raciocínio multi-imagem. Ele também mostra forte desempenho em tarefas apenas de texto, como seguir instruções e uso de ferramentas. O LFM2.5-VL-3B é otimizado para inferência no dispositivo, atingindo 228 tokens por segundo em um M5 Max e 116 tokens por segundo em um Ryzen AI Max+ 395, e até 20 tokens por segundo em um Galaxy S26 Ultra. Ele suporta entrada multi-frame com baixa latência e alta taxa de transferência em GPUs, alcançando cerca de 11 mil tokens de saída por segundo em alta concorrência. O modelo está disponível no Hugging Face e é compatível com os principais frameworks de inferência, incluindo transformers, vLLM e llama.cpp.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas