Combien de jetons dans une capture d'écran : GPT, Claude et Gemini comptabilisent les images différemment
OpenAI
Anthropic
Google/DeepMind
À partir d'une capture d'écran de test de 1920x1080, l'article calcule le coût en jetons visuels pour l'entrée d'images dans GPT-5.5, Claude Opus 4.8 et Gemini 3.1 Pro Preview, sur la base de la documentation des développeurs. Il explique comment chaque modèle traite les images, compare les quantités de jetons et propose des conseils pratiques pour préparer des captures d'écran en vue d'une analyse.
L'article examine comment différents modèles d'IA comptent les jetons visuels pour les entrées d'images, en prenant l'exemple d'une capture d'écran de 1920x1080. GPT-5.5 utilise une grille de pixels de 32x32, ce qui donne 2040 jetons visuels. Claude Opus 4.8 utilise une grille de pixels de 28x28, soit 2691 jetons. Gemini 3.1 Pro Preview utilise des budgets approximatifs via media_resolution, le mode élevé allouant jusqu'à 1120 jetons. L'article aborde également les effets du recadrage : un fragment de 960x540 réduit le nombre de jetons à 510 pour GPT et 700 pour Claude, bien que le budget de Gemini reste le même. Il conseille de préparer les captures d'écran en supprimant les éléments superflus et, éventuellement, d'envoyer à la fois une vue complète et un fragment zoomé. Pour la génération d'images, l'article précise que GPT Image 2 a produit une image de 1024x1024 utilisant 4160 jetons, coûtant 187 200 CAPS, tandis que Nano Banana 2 a coûté 67 200 CAPS pour une génération similaire.
Source: Habr — хаб ML —
original
