Kuinka monta tokenia kuvakaappauksessa on: GPT, Claude ja Gemini laskevat kuvat eri tavalla
OpenAI
Anthropic
Google/DeepMind
Artikkelissa lasketaan 1920x1080-testikuvakaappauksen avulla visuaalisen tokenin hinta kuvasyötteelle GPT-5.5-, Claude Opus 4.8- ja Gemini 3.1 Pro Preview -malleissa kehittäjädokumentaation perusteella. Siinä selitetään, miten kukin malli käsittelee kuvia, verrataan tokenimääriä ja annetaan käytännön neuvoja kuvakaappausten valmisteluun analyysiä varten.
Artikkelissa tarkastellaan, miten eri tekoälymallit laskevat kuvasyötteiden visuaaliset tokenit käyttäen esimerkkinä 1920x1080-kuvakaappausta. GPT-5.5 käyttää 32x32 pikselin ruudukkoa, jolloin visuaalisia tokeneita syntyy 2040. Claude Opus 4.8 käyttää 28x28 pikselin ruudukkoa, mikä tuottaa 2691 tokenia. Gemini 3.1 Pro Preview käyttää likimääräisiä budjetteja media_resolution-parametrin kautta, ja korkea tila varaa jopa 1120 tokenia. Tekstissä käsitellään myös rajauksen vaikutuksia: 960x540-kokoinen fragmentti vähentää tokenimäärän 510:een GPT:lle ja 700:aan Claudelle, mutta Geminin budjetti pysyy samana. Siinä neuvotaan valmistelemaan kuvakaappaukset poistamalla tarpeettomat elementit ja lähettämään haluttaessa sekä koko näkymä että zoomattu fragmentti. Kuvageneroinnin osalta artikkeli toteaa, että GPT Image 2 tuotti 1024x1024-kuvan käyttäen 4160 tokenia, mikä maksoi 187200 CAPS-yksikköä, kun taas Nano Banana 2 maksoi samankaltaisesta generaatiosta 67200 CAPS-yksikköä.
Lähde: Habr — хаб ML —
Alkuperäinen
