मॉडलअनुप्रयोग 🇷🇺 12.08.2026 10:01

स्क्रीनशॉट में कितने टोकन: GPT, Claude और Gemini छवियों की गणना अलग-अलग तरीके से करते हैं

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind
1920x1080 टेस्ट स्क्रीनशॉट का उपयोग करके, यह लेख डेवलपर दस्तावेज़ों के आधार पर GPT-5.5, Claude Opus 4.8 और Gemini 3.1 Pro Preview में इमेज इनपुट के लिए विज़ुअल टोकन लागत की गणना करता है। यह बताता है कि प्रत्येक मॉडल छवियों को कैसे प्रोसेस करता है, टोकन गिनती की तुलना करता है, और विश्लेषण के लिए स्क्रीनशॉट तैयार करने पर व्यावहारिक सलाह देता है।
यह लेख जांचता है कि विभिन्न AI मॉडल छवि इनपुट के लिए विज़ुअल टोकन कैसे गिनते हैं, उदाहरण के तौर पर 1920x1080 स्क्रीनशॉट का उपयोग करते हुए। GPT-5.5 32x32 पिक्सेल ग्रिड का उपयोग करता है, जिसके परिणामस्वरूप 2040 विज़ुअल टोकन बनते हैं। क्लॉड ओपस 4.8 28x28 पिक्सेल ग्रिड का उपयोग करता है, जो 2691 टोकन देता है। जेमिनी 3.1 प्रो प्रीव्यू media_resolution के माध्यम से अनुमानित बजट का उपयोग करता है, जिसमें हाई मोड 1120 टोकन तक आवंटित करता है। लेख क्रॉपिंग के प्रभावों पर भी चर्चा करता है: 960x540 खंड GPT के लिए टोकन संख्या को घटाकर 510 और क्लॉड के लिए 700 कर देता है, हालांकि जेमिनी का बजट समान रहता है। यह अनावश्यक तत्वों को हटाकर स्क्रीनशॉट तैयार करने और वैकल्पिक रूप से पूर्ण दृश्य और ज़ूम किया हुआ खंड दोनों भेजने की सलाह देता है। छवि निर्माण के लिए, लेख नोट करता है कि GPT इमेज 2 ने 4160 टोकन का उपयोग करके 1024x1024 छवि बनाई, जिसकी लागत 187,200 CAPS थी, जबकि नैनो बनाना 2 ने समान निर्माण के लिए 67,200 CAPS खर्च किए।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार