Berapa Banyak Token dalam Tangkapan Layar: GPT, Claude, dan Gemini Menghitung Gambar dengan Cara Berbeda
OpenAI
Anthropic
Google/DeepMind
Menggunakan tangkapan layar uji berukuran 1920x1080, artikel ini menghitung biaya token visual untuk input gambar pada GPT-5.5, Claude Opus 4.8, dan Gemini 3.1 Pro Preview berdasarkan dokumentasi pengembang. Artikel ini menjelaskan bagaimana setiap model memproses gambar, membandingkan jumlah token, dan memberikan saran praktis dalam menyiapkan tangkapan layar untuk analisis.
Artikel ini membahas bagaimana model AI yang berbeda menghitung token visual untuk input gambar, menggunakan tangkapan layar 1920x1080 sebagai contoh. GPT-5.5 menggunakan kisi 32x32 piksel, menghasilkan 2040 token visual. Claude Opus 4.8 menggunakan kisi 28x28 piksel, menghasilkan 2691 token. Gemini 3.1 Pro Preview menggunakan perkiraan anggaran melalui media_resolution, dengan mode tinggi mengalokasikan hingga 1120 token. Bagian ini juga membahas efek pemotongan: fragmen 960x540 mengurangi jumlah token menjadi 510 untuk GPT dan 700 untuk Claude, meskipun anggaran Gemini tetap sama. Disarankan untuk menyiapkan tangkapan layar dengan menghapus elemen yang tidak perlu dan opsional mengirimkan tampilan penuh serta fragmen yang diperbesar. Untuk pembuatan gambar, artikel mencatat bahwa GPT Image 2 menghasilkan gambar 1024x1024 menggunakan 4160 token, dengan biaya 187.200 CAPS, sementara Nano Banana 2 membutuhkan 67.200 CAPS untuk pembuatan serupa.
Sumber: Habr — хаб ML —
asli
