блокируется во время выполнения задач. В-третьих, добавлено кеширование состояний CUDA без привязки к синхронизации CPU, что особенно полезно при параллельном выполнении нескольких инстанций модели на одной GPU. В-четвёртых, представлена экспериментальная функция SwiftKV, которая на этапе декодирования в автогрессивной генерации работает быстрее стандартных подходов. Эти изменения ориентированы на разработчиков, создающих локальные ИИ-приложения, и позволяют увеличить как скорость инференса, так и пропускную способность на различном аппаратном обеспечении.