От LLM к агенту: понимание слоев между моделью и приложением
Google/DeepMind
OpenAI
Mistral
Эта статья исследует слои между LLM (большой языковой моделью) и агентом-приложением, начиная с токенизации, семплирования и KV-кэша, проходя через шаблоны чатов и Jinja, до форматов хранения моделей и рантаймов, таких как llama.cpp. В ней объясняются распространенные ошибки, такие как потребление бюджета генерации токенами рассуждений и проблемы с длиной контекста.
В статье описывается полный путь от LLM до агента. В основе лежит модель, предсказывающая следующий токен в авторегрессивном цикле, с использованием токенизатора для преобразования текста в идентификаторы токенов и детокенизатора для обратного преобразования. KV-кэш ускоряет генерацию, сохраняя предыдущие пары ключ-значение. Входной текст, ожидаемый моделью, — это не сырой JSON, а
Показать ещё ↓
Источник: Habr — хаб ML —
оригинал
