スクリーンショットのトークン数:GPT、Claude、Geminiの画像カウント方法の違い
OpenAI
Anthropic
Google/DeepMind
1920x1080のテストスクリーンショットを使用して、開発者向けドキュメントに基づき、GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro Previewの画像入力におけるビジュアルトークンのコストを計算します。各モデルが画像をどのように処理するか、トークン数の比較、分析用スクリーンショットの準備に関する実践的なアドバイスを説明します。
この記事では、様々なAIモデルが画像入力に対して視覚トークンをどのように数えるかについて、1920x1080のスクリーンショットを例に検証しています。GPT-5.5は32x32ピクセルのグリッドを使用し、結果として2040の視覚トークンになります。Claude Opus 4.8は28x28ピクセルのグリッドを使用し、2691トークンになります。Gemini 3.1 Pro Previewはmedia_resolutionを介しておおよその予算を使用し、ハイモードでは最大1120トークンが割り当てられます。この記事ではまた、クロッピングの効果についても論じています。960x540の断片では、GPTのトークン数は510に、Claudeのそれは700に減少しますが、Geminiの予算は同じままです。不要な要素を削除してスクリーンショットを準備し、必要に応じて全体像とズームした断片の両方を送ることを推奨しています。画像生成に関しては、GPT Image 2が1024x1024の画像を生成する際に4160トークンを使用し、187,200 CAPSのコストがかかった一方、Nano Banana 2は同様の生成で67,200 CAPSであったと記事は述べています。
出典: Habr — хаб ML —
原文
