جيميني فلاش 3.6: ليس أذكى، لكنه أرخص بشكل ملحوظ
Google/DeepMind
أصدرت جوجل ثلاثة نماذج: جيميني 3.6 فلاش (الرئيسي)، جيميني 3.5 فلاش-لايت (سريع/رخيص)، وجيميني 3.5 فلاش سيبر (للأمان، مقيد). التحسين الرئيسي هو تقليص بنسبة 17% في عدد رموز المخرجات لنفس المهام، مما يؤدي إلى توفير في التكاليف بنسبة 31-71% في السيناريوهات الوكيلية. ومع ذلك، تراجع أداء التحليل البصري للنموذج، خاصة مع المخططات. جيميني 3.5 فلاش-لايت هو مفاجأة من حيث القيمة، حيث يتفوق أحيانًا على نماذج الفئة المتوسطة الأقدم. أعلنت جوجل أيضًا عن اختبار داخلي لجيميني 3.5 برو وبدء التدريب المسبق لجيميني 4.
في 21 يوليو، أصدرت Google ثلاثة نماذج: Gemini 3.6 Flash (يحل محل 3.5 Flash، بسعر 1.50 دولارًا/7.50 دولارًا لكل مليون توكن)، وGemini 3.5 Flash-Lite (فائق السرعة ومنخفض التكلفة بسعر 0.30 دولارًا/2.50 دولارًا)، وGemini 3.5 Flash Cyber (للبحث عن الثغرات الأمنية، مخصص للحكومات فقط). الرقم الرئيسي هو انخفاض بنسبة 17% في التوكنات المخرجة مقارنةً بـ 3.5 Flash وفقًا لتحليل Artificial Analysis، ليصل إلى توفير 65% في معيار الترميز DeepSWE (97 ألف توكن مقابل 276 ألفًا). مؤشر الذكاء الإجمالي (50 نقطة) لم يتغير. في المعايير، تحسّن 3.6 Flash في DeepSWE (من 37% إلى 49%)، وMLE-Bench (من 49.7% إلى 63.9%)، وOSWorld-Verified (من 78.4% إلى 83.0%)، واستدعاء السياق الطويل (من حوالي 27% إلى 54%)، لكنه تأخر خلف المنافسين الأوائل مثل Grok 4.5 وClaude Sonnet 5 في الترميز الخالص (SWE-Bench Pro 58.7% مقابل 64.7%) ومهام المعرفة (GDPval-AA Elo 1421 مقابل 1607 لـ Sonnet 5). تراجع ملحوظ: وجد جيري ليو، الرئيس التنفيذي لشركة LlamaIndex، أن قراءة المخططات في ParseBench انخفضت من 45% إلى 31%، ونتائج المستندات من 69.9 إلى 66.8، وهو على الأرجح مقايضة نتيجة التركيز في مرحلة ما بعد التدريب على الترميز والوكلاء. نموذج Flash-Lite هو الخيار المميز من حيث القيمة: سرعة إخراج 350 توكنًا/ثانية، متجاوزًا نموذج Gemini 3 Flash الأقدم في بعض الاختبارات (SWE-Bench Pro 54.2% مقابل 49.6%، OSWorld-Verified 74.0% مقابل 65.1%) وأرخص من Claude Haiku 4.5. أما Flash Cyber، المبني على 3.5 Flash، فقد وجد 55 مشكلة فريدة في Chrome V8 (مقابل 47 للإصدار الأساسي و36 لـ Claude Opus 4.6) وسجل 83.2% في معيار CyberGym (الرابع بين النماذج المتخصصة). كما أشارت Google إلى الاختبار الداخلي لـ Gemini 3.5 Pro مع الشركاء وبدء التدريب المسبق لـ Gemini 4.
المصدر: Habr — хаб ИИ —
الأصلي
