Grok Imagine Image 2.0: رهان على التحرير، وليس التوليد
xAI
OpenAI
ByteDance
أصدرت شركة xAI الإصدار Imagine Image 2.0، وهو مولّد صور يركز على التحرير التكراري بدلاً من التوليد لمرة واحدة. يتضمن ميزات مثل تحرير المناطق، وإزالة الخلفية، ودعم المراجع المتعددة، وتغيير الحجم الذكي، مع معايير تضعه في المرتبة الثانية في كل من مجالي تحرير الصور وتوليد النص إلى صورة. النموذج متاح حالياً عبر واجهة برمجة تطبيقات Vercel AI Gateway بتكلفة أقل من المنافسين.
أطلقت xAI نموذج Imagine Image 2.0، واصفة إياه كأداة للعمل التكراري الحقيقي على الصور وليس مجرد مولّد صور جميلة آخر. يركز النموذج الجديد على التحرير الدقيق مع ميزات مثل "العصا السحرية" للتحرير الموضعي، وتقسيم الصورة لاختيار المناطق، وإزالة الخلفية مع تصدير بصيغة PNG، والتحرير متعدد المراجع الذي يدعم ما يصل إلى خمس صور. يدعم تغيير الحجم الذكي تسع نسب أبعاد، وهناك 15 قالب سير عمل للمهام النموذجية مثل تحرير الصور، وأصول التسويق، وأصول الألعاب. يهدف النموذج أيضًا إلى تحقيق الاتساق عبر الشخصيات والمشاهد، لاستهداف سير عمل إنتاج الفيديو. في المعايير، يحتل المرتبة الثانية في حلبة تحرير الصور بتقييم Elo يبلغ 1439، وفي حلبة تحويل النص إلى صورة يبلغ 1320، متخلفًا عن نموذج GPT-Image-2. الوصول إليه حاليًا عبر واجهة برمجة تطبيقات Vercel AI Gateway بسعر 0.05 دولار لكل توليد، وهو أرخص من Seedream 5 Pro وNano Banano 2 وGPT Image 2، على الرغم من أنه أبطأ من Nano Banano 2 لكنه أسرع من GPT Image 2. يلاحظ الكاتب أنه بينما تتخلف النماذج الصينية عن Nano Banano 2، فمن المرجح أن يصبح هذا النموذج بأسعاره المعقولة وجودته العالية خطًا أساسيًا للكثيرين، حتى لو لم تكن جميع ميزات الواجهة البرمجية تعمل حاليًا. في روسيا، النموذج غير متوفر بعد إلا من خلال وصول غير رسمي إلى المعاينة على Vercel AI Gateway، لكن الإصدار وشيك، مع توفره على خدمات متنوعة بما في ذلك VEGA هذا الأسبوع.
المصدر: Habr — хаб ИИ —
الأصلي
