Liquid AI apresenta o LFM2.5-VL-3B: um modelo compacto de visão-linguagem para leitura de tela, ancoragem de objetos e chamada de ferramentas no dispositivo
Liquid AI
Google/DeepMind
A Liquid AI lançou o LFM2.5-VL-3B, um modelo de visão-linguagem com 3,1 bilhões de parâmetros para implantação no dispositivo. Ele se destaca na leitura de telas digitais, ancoragem de objetos e chamada de ferramentas, alcançando uma média de 69,4 em 28 benchmarks de visão, equiparando-se a modelos maiores. O modelo ocupa cerca de 3 GB de memória e funciona de forma eficiente em hardware da Apple, com uma licença aberta exclusiva que é gratuita para empresas com receita anual inferior a 10 milhões de dólares.
A Liquid AI anunciou o lançamento do LFM2.5-VL-3B, um modelo de visão-linguagem de 3,1 bilhões de parâmetros projetado para implantação em dispositivos. O modelo lê telas digitais em mobile, web e desktop, localiza objetos em coordenadas, processa documentos e gráficos e chama ferramentas a partir de entrada de texto ou imagem. Ele tem média de 69,4 em 28 benchmarks de visão, igualando o InternVL-3.5-4B e ficando 0,7 pontos atrás do Qwen3.5-4B, ambos modelos de 4,7 bilhões de parâmetros. O modelo não é de raciocínio para manter baixa latência, ocupa aproximadamente 3 GB de memória e decodifica 228 tokens por segundo em um Apple M5 Max. O checkpoint está disponível nos formatos nativo, GGUF, ONNX e MLX, com suporte desde o primeiro dia para llama.cpp, MLX, vLLM, SGLang e runtimes ONNX. A Licença Aberta LFM v1.0 é baseada na Apache-2.0, mas o uso comercial gratuito termina quando a receita anual de uma empresa atinge US$ 10 milhões. As principais melhorias em relação à versão anterior incluem uma média de 80,7 no ScreenSpot-v2, um aumento no precision@1 do RefCOCO-avg de 57,1 para 87,9 e novas capacidades de chamada de função, com as pontuações do ToolSandbox subindo de 26,4 para 59,5.
Fonte: MarkTechPost —
original
