Агенты 🇷🇺 24.07.2026 05:03

Агенты, или Путешествие к LLM и обратно

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
Статья подробно разбирает внутреннее устройство LLM, начиная от токенизации и генерации текста, через chat template и форматирование диалогов, до роли KV-кэша и reasoning-блоков. Объясняется, как JSON-запросы преобразуются в промпты с учётом разметки разных моделей, и как это влияет на биллинг и лимиты контекста.
В центре любой агентной схемы остаётся LLM, которая предсказывает следующий токен. Текст запроса сначала токенизируется — преобразуется в последовательность целочисленных ID из словаря модели. Затем авторегрессивно, токен за токеном, генерируется ответ, пока не встретится спецтокен конца или не будет достигнут лимит длины. Для ускорения генерации используется KV-кэш, который сохраняет ключи и
Показать ещё ↓
Сокращения
LLM = Large Language Model — большая языковая модель
JSON = JavaScript Object Notation — нотация объектов JavaScript
KV = Key-Value — ключ-значение
EOS = End of Sequence — конец последовательности
GGUF = GPT-Generated Unified Format — унифицированный формат для GPT
Источник: Habr — хаб ML — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости