Агенты, или Путешествие к LLM и обратно
Статья подробно разбирает внутреннее устройство LLM, начиная от токенизации и генерации текста, через chat template и форматирование диалогов, до роли KV-кэша и reasoning-блоков. Объясняется, как JSON-запросы преобразуются в промпты с учётом разметки разных моделей, и как это влияет на биллинг и лимиты контекста.
Google/DeepMind
OpenAI
Mistral
Habr — хаб ML24.07 · 05:03

