Bir Ekran Görüntüsünde Kaç Token Var: GPT, Claude ve Gemini Görselleri Farklı Şekilde Sayıyor
OpenAI
Anthropic
Google/DeepMind
1920x1080 test ekran görüntüsü kullanılarak, makale geliştirici dokümantasyonuna dayanarak GPT-5.5, Claude Opus 4.8 ve Gemini 3.1 Pro Preview için görsel giriş token maliyetini hesaplıyor. Her modelin görselleri nasıl işlediğini açıklıyor, token sayılarını karşılaştırıyor ve analiz için ekran görüntüleri hazırlamada pratik tavsiyeler sunuyor.
Bu makale, farklı yapay zeka modellerinin görsel belirteçleri görüntü girişleri için nasıl saydığını, 1920x1080 ekran görüntüsü örneği üzerinden inceliyor. GPT-5.5, 32x32 piksellik bir ızgara kullanarak 2040 görsel belirteç elde ediyor. Claude Opus 4.8, 28x28 piksellik bir ızgara kullanarak 2691 belirteç veriyor. Gemini 3.1 Pro Preview, media_resolution üzerinden yaklaşık bütçeler kullanıyor ve yüksek modda 1120 belirtece kadar ayırıyor. Parça ayrıca kırpmanın etkilerini de tartışıyor: 960x540'lık bir parça, GPT için belirteç sayısını 510'a, Claude için 700'e düşürüyor, ancak Gemini'nin bütçesi aynı kalıyor. Gereksiz öğeleri kaldırarak ve isteğe bağlı olarak hem genel görünümü hem de yakınlaştırılmış bir parçayı göndererek ekran görüntülerini hazırlamayı öneriyor. Görüntü üretimi için makale, GPT Image 2'nin 4160 belirteç kullanarak 1024x1024 bir görüntü ürettiğini ve 187.200 CAPS'e mal olduğunu, Nano Banana 2'nin ise benzer üretim için 67.200 CAPS'e mal olduğunu belirtiyor.
Kaynak: Habr — хаб ML —
orijinal
