ModelosAplicações 🇷🇺 12.08.2026 10:01

Quantos Tokens Existem em uma Captura de Tela: GPT, Claude e Gemini Contam Imagens de Forma Diferente

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind
Usando uma captura de tela de teste de 1920x1080, o artigo calcula o custo de tokens visuais para entrada de imagem em GPT-5.5, Claude Opus 4.8 e Gemini 3.1 Pro Preview, com base na documentação para desenvolvedores. Ele explica como cada modelo processa imagens, compara as contagens de tokens e oferece conselhos práticos sobre como preparar capturas de tela para análise.
O artigo examina como diferentes modelos de IA contam tokens visuais para entradas de imagem, usando como exemplo uma captura de tela de 1920x1080. O GPT-5.5 usa uma grade de pixels de 32x32, resultando em 2040 tokens visuais. O Claude Opus 4.8 usa uma grade de pixels de 28x28, gerando 2691 tokens. O Gemini 3.1 Pro Preview usa orçamentos aproximados via media_resolution, com o modo alto alocando até 1120 tokens. A peça também discute os efeitos do corte: um fragmento de 960x540 reduz a contagem de tokens para 510 no GPT e 700 no Claude, embora o orçamento do Gemini permaneça o mesmo. Recomenda-se preparar capturas de tela removendo elementos desnecessários e, opcionalmente, enviar tanto uma visão geral quanto um fragmento ampliado. Para geração de imagens, o artigo observa que o GPT Image 2 produziu uma imagem de 1024x1024 usando 4160 tokens, custando 187.200 CAPS, enquanto o Nano Banana 2 custou 67.200 CAPS para uma geração semelhante.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas