LFM2.5-VL-3B: El nuevo modelo de visión y lenguaje de Liquid AI para dispositivos de borde
Liquid AI
Google/DeepMind
Alibaba/Qwen
Liquid AI ha lanzado LFM2.5-VL-3B, un modelo compacto de visión y lenguaje diseñado para una inferencia eficiente en el dispositivo. Ofrece mejoras en comprensión de pantallas, anclaje visual (grounding), razonamiento con múltiples imágenes y llamada a funciones. El modelo supera a competidores de tamaño similar en muchos puntos de referencia, estando optimizado para el despliegue en CPU y GPU.
Liquid AI ha anunciado el lanzamiento de LFM2.5-VL-3B, un modelo de visión-lenguaje de 3,1 mil millones de parámetros para dispositivos de borde. Combina un codificador de visión SigLIP2 400M NaFlex con la columna vertebral de texto LFM2.5-2.6B de la compañía y se entrenó con aproximadamente 34 billones de tokens, con cuatro veces más datos de visión que las versiones anteriores. El modelo alcanza resultados de última generación en su clase de tamaño en muchos puntos de referencia de visión, incluida la comprensión de pantalla, el anclaje (grounding) y el razonamiento multiimagen. También muestra un rendimiento sólido en tareas de solo texto, como el seguimiento de instrucciones y el uso de herramientas. LFM2.5-VL-3B está optimizado para la inferencia en el dispositivo, alcanzando 228 tokens por segundo en un M5 Max y 116 tokens por segundo en un Ryzen AI Max+ 395, e incluso 20 tokens por segundo en un Galaxy S26 Ultra. Admite entrada de múltiples fotogramas con baja latencia y alto rendimiento en GPU, logrando aproximadamente 11 mil tokens de salida por segundo en alta concurrencia. El modelo está disponible en Hugging Face y es compatible con los principales marcos de inferencia, incluidos Transformers, vLLM y llama.cpp.
Fuente: Hugging Face blog —
original
