LFM2.5-VL-3B: نموذج الرؤية واللغة الجديد من Liquid AI للأجهزة الطرفية

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
أصدرت شركة Liquid AI نموذج LFM2.5-VL-3B، وهو نموذج مدمج للرؤية واللغة مصمم للاستدلال الفعال على الأجهزة. يوفر تحسينات في فهم الشاشة، والتأريض، والاستدلال متعدد الصور، واستدعاء الوظائف. يتفوق النموذج على المنافسين ذوي الحجم المماثل في العديد من المعايير مع كونه محسنًا للنشر على وحدات المعالجة المركزية ووحدات معالجة الرسوميات.
أعلنت شركة Liquid AI عن إصدار نموذج LFM2.5-VL-3B، وهو نموذج رؤية-لغة بمعاملات تبلغ 3.1 مليار معامل، مخصص للأجهزة الطرفية. يجمع هذا النموذج بين مُشفِّر الرؤية SigLIP2 400M NaFlex والعمود الفقري النصي للشركة LFM2.5-2.6B، وتم تدريبه على حوالي 34 تريليون رمز، مع بيانات رؤية أكثر بأربع مرات من الإصدارات السابقة. يحقق النموذج نتائج متطورة في فئته الحجمية على العديد من معايير الرؤية، بما في ذلك فهم الشاشة، والتأريض، والاستدلال متعدد الصور. كما يُظهر أداءً قويًا في المهام النصية فقط مثل اتباع التعليمات واستخدام الأدوات. تم تحسين LFM2.5-VL-3B للاستدلال على الجهاز، حيث يصل إلى 228 رمزًا في الثانية على معالج M5 Max و116 رمزًا في الثانية على معالج Ryzen AI Max+ 395، وحتى 20 رمزًا في الثانية على Galaxy S26 Ultra. يدعم الإدخال متعدد الإطارات مع زمن انتقال منخفض وإنتاجية عالية على وحدات معالجة الرسوميات، محققًا حوالي 11 ألف رمز إخراج في الثانية عند التزامن العالي. النموذج متاح على منصة Hugging Face ومتوافق مع أطر الاستدلال الرئيسية بما في ذلك transformers وvLLM وllama.cpp.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة