النماذجالعوامل 🇺🇸 13.08.2026 19:06

ليكويد إيه آي تكشف عن LFM2.5-VL-3B: نموذج رؤية ولغة مضغوط لقراءة الشاشات وتحديد الأجسام واستدعاء الأدوات على الأجهزة

Liquid AILiquid AI Google/DeepMindGoogle/DeepMind
أطلقت شركة ليكويد إيه آي نموذج LFM2.5-VL-3B، وهو نموذج رؤية ولغة يحتوي على 3.1 مليار معلمة مصمم للنشر على الأجهزة. يتميز بقدرته على قراءة الشاشات الرقمية، وتحديد الأجسام، واستدعاء الأدوات، محققًا متوسط 69.4 عبر 28 معيارًا للرؤية، مما يضاهي النماذج الأكبر حجمًا. يشغل النموذج حوالي 3 غيغابايت من الذاكرة ويعمل بكفاءة على أجهزة آبل، مع ترخيص مفتوح فريد مجاني للشركات التي يقل إيرادها السنوي عن 10 ملايين دولار.
أعلنت شركة Liquid AI عن إصدار نموذج LFM2.5-VL-3B، وهو نموذج رؤية-لغة بحجم 3.1 مليار معلمة مصمم للنشر على الأجهزة. يقرأ النموذج الشاشات الرقمية عبر الهواتف المحمولة والويب وأجهزة الكمبيوتر المكتبية، ويحدد العناصر بإحداثياتها، ويحلل المستندات والرسوم البيانية، ويستدعي الأدوات من المدخلات النصية أو الصورية. يبلغ متوسط أدائه 69.4 عبر 28 معيارًا لقياس الرؤية، مما يضاهي نموذج InternVL-3.5-4B ويتخلف بمقدار 0.7 نقطة عن نموذج Qwen3.5-4B، وكلاهما نماذج بحجم 4.7 مليار معلمة. النموذج غير قائم على التفكير للحفاظ على زمن استجابة منخفض، ويشغل حوالي 3 غيغابايت من الذاكرة، ويفك تشفير 228 رمزًا في الثانية على معالج Apple M5 Max. يتوفر النموذج بصيغ أصلية، وGGUF، وONNX، وMLX، مع دعم فوري لبيئات التشغيل llama.cpp، وMLX، وvLLM، وSGLang، وONNX. ترخيص LFM Open License v1.0 مبني على ترخيص Apache-2.0، لكن الاستخدام التجاري المجاني ينتهي عندما يصل الإيراد السنوي للشركة إلى 10 ملايين دولار. تشمل التحسينات الرئيسية مقارنة بالإصدار السابق متوسط 80.7 في اختبار ScreenSpot-v2، وزيادة دقة precision@1 في اختبار RefCOCO-avg من 57.1 إلى 87.9، وقدرات جديدة لاستدعاء الأدوات مع تحسن درجات ToolSandbox من 26.4 إلى 59.5.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة