Miksi neuroverkot syövät tokenit: mitä pitkissä keskusteluissa tapahtuu ja miten kustannuksia voi leikata
Anthropic
SYNTX.AI
Pitkät tekoälykeskustelut valtavine konteksti-ikkunoineen kasvattavat token-kustannuksia ja voivat heikentää mallin suorituskykyä. Reddit-käyttäjä kertoi käyttäneensä yli miljardi syötetokenia Clauden kanssa, kun taas toinen sai noin 6 000 dollarin laskun valvomattomasta tekoälyagentista. Tutkimukset, kuten 'Context Rot', osoittavat, että suorituskyky laskee kontekstin kasvaessa, ja asiantuntijat suosittelevat tehtävien jakamista, historian tiivistämistä ja prompt-välimuistin käyttöä säästöjen saavuttamiseksi.
Artikkelissa käsitellään sitä, miksi tekoälymallit kuluttavat liikaa tokeneita pitkissä keskusteluissa ja miten kustannuksia voidaan vähentää. Siinä viitataan Redditissä julkaistuihin kokemuksiin: yksi käyttäjä kulutti 1,156 miljardia syöttötokenia Clauden kanssa, toinen unohti pysäyttää Claude Code -agentin, joka tarkisti vetopyyntöjä 30 minuutin välein 26 tunnin ajan, yhteensä 46 kertaa, ja lasku oli noin 6000 dollaria. Tekninen syy korkeisiin kustannuksiin on se, että jokainen uusi pyyntö sisältää koko kertyneen keskustelukontekstin, joka voi kasvaa 800 000 tokeniin. Anthropic varoittaa dokumentaatiossaan, että kustannukset nousevat kontekstin koon kasvaessa, ja suosittelee historian tyhjentämistä tai tiivistämistä. Chroman tutkimus ('Context Rot') ja vuoden 2026 tutkimus ('Diagnosing and Mitigating Context Rot') osoittavat, että suorituskyky heikkenee pidempien syötteiden myötä jo ennen konteksti-ikkunan rajaa, erityisesti harhauttavan tiedon kanssa. Prompt-välimuisti vähentää kustannuksia vain toistuvien etuliitteiden osalta, ei ratkaise tarpeettoman kontekstin ongelmaa. Tekoälyagenttien kohdalla kustannukset ovat piilossa, koska ne suorittavat monia työkaluoperaatioita itsenäisesti. Käytännön vinkkejä ovat riippumattomien tehtävien jakaminen, /clear- ja /compact-komentojen käyttö Claude Codessa, vain olennaisten dokumenttiosien antaminen, vakaiden ohjeiden tallentaminen välimuistiin ja oikean mallitason valinta (Sonnet koodaukseen, Opus monimutkaiseen päättelyyn, Haiku yksinkertaisiin alatason tehtäviin). Kirjoittaja mainostaa myös SYNTX.AI:n LLM Studiota, joka tarjoaa yli 100 tekoälymallia ja mahdollisuuden vaihtaa mallia keskustelun aikana, sekä tarjouskoodin CTRLAI, joka antaa 20 prosentin alennuksen. Artikkeli päättyy siihen, että prompt-insinöörityön on nyt sisällettävä myös tarpeettoman tiedon hylkääminen.
Lähde: Habr — хаб ИИ —
Alkuperäinen
