Wie viele Tokens hat ein Screenshot: GPT, Claude und Gemini zählen Bilder unterschiedlich
OpenAI
Anthropic
Google/DeepMind
Anhand eines 1920x1080-Test-Screenshots berechnet der Artikel die visuellen Token-Kosten für die Bildeingabe bei GPT-5.5, Claude Opus 4.8 und Gemini 3.1 Pro Preview auf Grundlage der Entwicklerdokumentation. Es wird erklärt, wie jedes Modell Bilder verarbeitet, die Token-Anzahlen verglichen und praktische Tipps zur Vorbereitung von Screenshots für die Analyse gegeben.
Der Artikel untersucht, wie verschiedene KI-Modelle visuelle Token für Bildeingaben zählen, am Beispiel eines 1920x1080-Screenshots. GPT-5.5 verwendet ein 32x32-Pixel-Raster, was 2040 visuelle Token ergibt. Claude Opus 4.8 verwendet ein 28x28-Pixel-Raster, was 2691 Token ergibt. Gemini 3.1 Pro Preview nutzt ungefähre Budgets über media_resolution, wobei der High-Modus bis zu 1120 Token vorsieht. Der Beitrag erörtert auch die Auswirkungen des Zuschneidens: Ein 960x540-Fragment reduziert die Token-Anzahl auf 510 bei GPT und 700 bei Claude, während das Budget von Gemini unverändert bleibt. Es wird empfohlen, Screenshots vorzubereiten, indem unnötige Elemente entfernt werden, und optional sowohl eine Gesamtansicht als auch ein gezoomtes Fragment zu senden. Bei der Bildgenerierung stellt der Artikel fest, dass GPT Image 2 ein 1024x1024-Bild mit 4160 Token erzeugte, was 187.200 CAPS kostete, während Nano Banana 2 für eine ähnliche Erzeugung 67.200 CAPS kostete.
Quelle: Habr — хаб ML —
Original
