一张截图消耗多少令牌:GPT、Claude 和 Gemini 对图像的计费方式各不相同
OpenAI
Anthropic
Google/DeepMind
本文以一张1920x1080分辨率的测试截图为例,根据开发者文档计算了在GPT-5.5、Claude Opus 4.8和Gemini 3.1 Pro Preview中图像输入产生的视觉令牌成本。文章解释了每个模型如何处理图像,比较了令牌数量,并为准备用于分析的截图提供了实用建议。
这篇文章以一张1920x1080的屏幕截图为例,探讨了不同AI模型如何计算图像输入的视觉令牌。GPT-5.5采用32x32像素的网格,从而生成2040个视觉令牌。Claude Opus 4.8采用28x28像素的网格,产生2691个令牌。Gemini 3.1 Pro预览版通过media_resolution使用近似预算,在高模式下最多分配1120个令牌。文章还讨论了裁剪的影响:一个960x540的片段将GPT的令牌数量减少到510个,将Claude的减少到700个,但Gemini的预算保持不变。文章建议通过移除不必要的元素来准备屏幕截图,并且可以选择同时发送完整视图和放大后的片段。在图像生成方面,文章指出GPT Image 2生成一张1024x1024的图像使用了4160个令牌,花费187,200个CAPS,而Nano Banana 2进行类似生成则花费67,200个CAPS。
来源: Habr — хаб ML —
原文
