Обновление llama.cpp b10075: четыре улучшения локального ИИ-движка
Meta
llama.cpp b10075 включает четыре ключевых улучшения для локального запуска ИИ-моделей: поддержка FP6 (6-битных чисел с плавающей точкой) на GPU от NVIDIA, AMD, Apple и Intel, ассинхронная обработка запросов, кеширование состояний CUDA без синхронизации CPU, а также предварительная версия технологии SwiftKV для ускорения автогрессивной генерации.
Вышел релиз llama.cpp b10075, который принёс четыре значительных улучшения для локального выполнения ИИ-моделей. Во-первых, добавлена поддержка FP6 — 6-битного формата с плавающей точкой — для GPU от NVIDIA, AMD, Apple и Intel, что позволяет снизить использование памяти и повысить эффективность вычислений. Во-вторых, реализована асинхронная обработка HTTP-запросов, благодаря чему веб-интерфейс не
Показать ещё ↓
- Сокращения
- GPU = Graphics Processing Unit — графический процессор
- CPU = Central Processing Unit — центральный процессор
- CUDA = Compute Unified Device Architecture — архитектура унифицированных вычислений на устройствах
Источник: Meta AI (GNews) —
оригинал
