النماذجالأبحاث 🇨🇳 28.07.2026 00:03

علي بابا تطلق QVQ-Max: نموذج الاستدلال البصري مع الأدلة

Alibaba/QwenAlibaba/Qwen
أصدرت شركة علي بابا رسمياً نموذج QVQ-Max، وهو أول إصدار من نموذج الاستدلال البصري الخاص بها. لا يمكنه فقط التعرف على الصور ومقاطع الفيديو، بل أيضاً تحليلها، وحل المهام من الرياضيات إلى الإبداع. وأشار المطورون إلى أن دقة النموذج على معيار MathVision تزداد مع طول عملية التفكير.
أعلنت Alibaba Qwen عن إطلاق QVQ-Max، أول إصدار من نموذج التفكير البصري الذي يتجاوز الإصدار الأولي QVQ-72B-Preview الذي صدر في ديسمبر. يفهم النموذج محتوى الصور والفيديو، ويحللها ويستنتج بناءً عليها، مما يساعد في حل المهام بدءًا من المسائل الرياضية وصولًا إلى الأسئلة اليومية والإبداع. في معيار MathVision، الذي يجمع مسائل رياضية متعددة الوسائط معقدة، تزداد دقة النموذج مع زيادة الحد الأقصى لطول عملية التفكير. يتمتع QVQ-Max بثلاث قدرات رئيسية: الملاحظة التفصيلية (اكتشاف الأشياء والنصوص والتفاصيل الدقيقة)، والتفكير العميق (الاستنتاجات بناءً على المعلومات البصرية والمعرفة الخلفية)، والتطبيق المرن (من حل المشكلات إلى إنشاء الرسوم التوضيحية والسيناريوهات). تشمل الأمثلة التوضيحية المساعدة في العمل (تحليل البيانات، كتابة الكود)، والتعلم (حل المسائل باستخدام المخططات)، والحياة اليومية (توصيات الملابس والوصفات). تتضمن الخطط المستقبلية تحسين دقة التعرف من خلال آليات التحقق، وتطوير وكيل بصري للمهام متعددة الخطوات (التحكم في الهاتف الذكي أو الكمبيوتر)، وتحسين التفاعل بإضافة أدوات وتوليد بصري.
المصدر: Alibaba Qwen — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة