скользящим окном и полными слоями внимания, групповое внимание с ограничением (gated grouped-query attention) для снижения потребления памяти KV-кэша, а также нормализацию Q и K. Модель также включает опциональный драфтер для спекулятивного декодирования, что ускоряет генерацию, особенно полезно для задач программирования. Результаты бенчмарков показывают высокую производительность в агентных задачах, таких как MCP Atlas, DeepSearch QA и SWE-Bench, а также мультимодальные возможности. Модель доступна на Hugging Face Hub, приведены примеры интеграции для текстового вывода, мультимодального вызова инструментов, обнаружения объектов и видеовывода с использованием transformers и llama.cpp.