Hoeveel Tokens Zit Er in een Schermafbeelding: GPT, Claude en Gemini Tell Afbeeldingen Anders
OpenAI
Anthropic
Google/DeepMind
Met behulp van een testschermafbeelding van 1920x1080 berekent het artikel de visuele tokencost voor beeldinvoer in GPT-5.5, Claude Opus 4.8 en Gemini 3.1 Pro Preview op basis van ontwikkelaarsdocumentatie. Het legt uit hoe elk model afbeeldingen verwerkt, vergelijkt het aantal tokens en biedt praktisch advies over het voorbereiden van schermafbeeldingen voor analyse.
Het artikel onderzoekt hoe verschillende AI-modellen visuele tokens tellen voor beeldinvoer, aan de hand van een screenshot van 1920x1080 als voorbeeld. GPT-5.5 gebruikt een raster van 32x32 pixels, wat resulteert in 2040 visuele tokens. Claude Opus 4.8 gebruikt een raster van 28x28 pixels, wat 2691 tokens oplevert. Gemini 3.1 Pro Preview gebruikt geschatte budgetten via media_resolution, waarbij de hoge modus tot 1120 tokens toewijst. Het stuk bespreekt ook de effecten van bijsnijden: een fragment van 960x540 verlaagt het aantal tokens tot 510 voor GPT en 700 voor Claude, hoewel het budget van Gemini hetzelfde blijft. Het adviseert om screenshots voor te bereiden door onnodige elementen te verwijderen en optioneel zowel een volledig beeld als een ingezoomd fragment te sturen. Voor beeldgeneratie merkt het artikel op dat GPT Image 2 een afbeelding van 1024x1024 produceerde met 4160 tokens, die 187.200 CAPS kostte, terwijl Nano Banana 2 voor een vergelijkbare generatie 67.200 CAPS kostte.
Bron: Habr — хаб ML —
origineel
