AgentitMallit 🇷🇺 24.07.2026 05:03

LLM:stä agentiksi: Mallin ja sovelluksen välisten kerrosten ymmärtäminen

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
Tämä artikkeli tutkii kerroksia kielimallin (LLM) ja agenttisovelluksen välillä alkaen tokenisoinnista, näytteenotosta ja KV-välimuistista, keskustelupohjien ja Jinjan kautta aina mallin tallennusformaatteihin ja suoritusaikoihin, kuten llama.cpp. Siinä selitetään yleisiä sudenkuoppia, kuten päättelytokenien kuluttama generointibudjetti ja kontekstin pituusongelmat.
Artikkelissa kuvataan täydellinen polku kielimallista agentiksi. Ytimessään malli ennustaa seuraavaa tokenia autoregressiivisessä silmukassa käyttäen tokenisaattoria muuttamaan tekstin token-tunnuksiksi ja detokenisaattoria muuttamaan takaisin. KV-välimuisti nopeuttaa generointia tallentamalla aiemmat avain-arvo-parit. Mallin odottama syöttöteksti ei ole raakaa JSONia vaan muotoiltu kehote mallin keskustelupohjan mukaisesti, joka on Jinja-pohja, joka muuntaa viestilistan merkkijonoksi erikoismerkeillä (esim. ChatML, Llama 3). Päättelymalleissa kehote voi sisältää <think>-lohkon; jos malli käyttää liian monta tokenia päättelyyn, se voi loppua generointibudjetti ennen lopullista vastausta. Artikkeli selittää myös, että laskutus ja kontekstipituus perustuvat tokenisoituun kehotteeseen keskustelupohjan jälkeen, eivät API-JSONiin. Mallin tallennus levylle sisältää safetensors-painot, config.jsonin, tokenisaattoritiedostot ja chat_template-tiedoston tokenizer_config.jsonissa. Suoritusympäristöt kuten llama.cpp lataavat GGUF-tiedoston, joka kokoaa nämä komponentit yhteen, tarjoten korkean tason rajapinnan tekstistä tekstiin.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset