LFM2.5-VL-3B: новая модель видения и языка от Liquid AI для периферийных устройств
Компания Liquid AI выпустила LFM2.5-VL-3B, компактную модель видения и языка, предназначенную для эффективного логического вывода на устройствах. Модель улучшает понимание экранов, grounding, рассуждения по нескольким изображениям и вызов функций. Она превосходит конкурентов аналогичного размера по многим тестам, оптимизирована для развертывания на центральных процессорах и графических процессорах.
Liquid AI объявила о выпуске LFM2.5-VL-3B — языковой модели зрения с 3,1 миллиарда параметров, предназначенной для периферийных устройств. Модель сочетает зрительный энкодер SigLIP2 400M NaFlex с текстовым базовым блоком LFM2.5-2.6B и была обучена на примерно 34 триллионах токенов, при этом объем данных по зрению в четыре раза больше, чем в предыдущих версиях. Модель достигает передовых
Показать ещё ↓
Источник: Hugging Face blog —
оригинал
