Обновление llama.cpp b10075: четыре улучшения локального ИИ-движка
llama.cpp b10075 включает четыре ключевых улучшения для локального запуска ИИ-моделей: поддержка FP6 (6-битных чисел с плавающей точкой) на GPU от NVIDIA, AMD, Apple и Intel, ассинхронная обработка запросов, кеширование состояний CUDA без синхронизации CPU, а также предварительная версия технологии SwiftKV для ускорения автогрессивной генерации.
Meta


