كم رمزًا في لقطة الشاشة: نماذج GPT وClaude وGemini تتعامل مع الصور بشكل مختلف
OpenAI
Anthropic
Google/DeepMind
باستخدام لقطة شاشة اختبارية بدقة 1920×1080، تحسب المقالة تكلفة الرموز المرئية لإدخال الصور في نماذج GPT-5.5 وClaude Opus 4.8 وGemini 3.1 Pro Preview استنادًا إلى التوثيق الرسمي للمطورين. تشرح المقالة كيفية معالجة كل نموذج للصور، وتقارن عدد الرموز، وتقدم نصائح عملية حول إعداد لقطات الشاشة لتحليلها بشكل فعال.
تتناول المقالة كيفية قيام نماذج الذكاء الاصطناعي المختلفة بحساب الرموز المرئية لمدخلات الصور، باستخدام لقطة شاشة بدقة 1920×1080 كمثال. يستخدم GPT-5.5 شبكة بكسل 32×32، مما ينتج عنه 2040 رمزًا مرئيًا. يستخدم Claude Opus 4.8 شبكة بكسل 28×28، مما يعطي 2691 رمزًا. تستخدم Gemini 3.1 Pro Preview ميزانيات تقريبية عبر media_resolution، حيث يخصص الوضع العالي ما يصل إلى 1120 رمزًا. كما تناقش القطعة تأثيرات الاقتصاص: فجزء بحجم 960×540 يقلل عدد الرموز إلى 510 لـ GPT و700 لـ Claude، بينما تظل ميزانية Gemini كما هي. وتنصح بتحضير لقطات الشاشة عن طريق إزالة العناصر غير الضرورية، وإرسال عرض كامل وجزء مكبّر اختياريًا. بالنسبة لتوليد الصور، تشير المقالة إلى أن GPT Image 2 أنتج صورة بدقة 1024×1024 باستخدام 4160 رمزًا، بتكلفة 187,200 نقطة CAPS، بينما كلف Nano Banana 2 حوالي 67,200 نقطة CAPS لتوليد مماثل.
المصدر: Habr — хаб ML —
الأصلي
