Cuántos tokens hay en una captura de pantalla: GPT, Claude y Gemini cuentan las imágenes de forma diferente
OpenAI
Anthropic
Google/DeepMind
Utilizando una captura de pantalla de prueba de 1920x1080, el artículo calcula el costo de tokens visuales para la entrada de imágenes en GPT-5.5, Claude Opus 4.8 y Gemini 3.1 Pro Preview, basándose en la documentación para desarrolladores. Explica cómo cada modelo procesa las imágenes, compara los recuentos de tokens y ofrece consejos prácticos para preparar capturas de pantalla para su análisis.
El artículo examina cómo diferentes modelos de IA cuentan los tokens visuales para las entradas de imagen, utilizando como ejemplo una captura de pantalla de 1920x1080. GPT-5.5 utiliza una cuadrícula de 32x32 píxeles, lo que resulta en 2040 tokens visuales. Claude Opus 4.8 utiliza una cuadrícula de 28x28 píxeles, dando 2691 tokens. Gemini 3.1 Pro Preview utiliza presupuestos aproximados mediante media_resolution, con el modo alto asignando hasta 1120 tokens. La pieza también discute los efectos del recorte: un fragmento de 960x540 reduce el recuento de tokens a 510 para GPT y 700 para Claude, aunque el presupuesto de Gemini permanece igual. Se aconseja preparar las capturas de pantalla eliminando elementos innecesarios y, opcionalmente, enviar tanto una vista completa como un fragmento ampliado. En cuanto a la generación de imágenes, el artículo señala que GPT Image 2 produjo una imagen de 1024x1024 utilizando 4160 tokens, con un coste de 187200 CAPS, mientras que Nano Banana 2 costó 67200 CAPS por una generación similar.
Fuente: Habr — хаб ML —
original
