АгентыМодели 🇷🇺 24.07.2026 05:03

От LLM к агенту: понимание слоев между моделью и приложением

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MistralMistral
Эта статья исследует слои между LLM (большой языковой моделью) и агентом-приложением, начиная с токенизации, семплирования и KV-кэша, проходя через шаблоны чатов и Jinja, до форматов хранения моделей и рантаймов, таких как llama.cpp. В ней объясняются распространенные ошибки, такие как потребление бюджета генерации токенами рассуждений и проблемы с длиной контекста.
В статье описывается полный путь от LLM до агента. В основе лежит модель, предсказывающая следующий токен в авторегрессивном цикле, с использованием токенизатора для преобразования текста в идентификаторы токенов и детокенизатора для обратного преобразования. KV-кэш ускоряет генерацию, сохраняя предыдущие пары ключ-значение. Входной текст, ожидаемый моделью, — это не сырой JSON, а
Показать ещё ↓
Источник: Habr — хаб ML — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости