Рекурсивный движок llama.cpp на RTX 3050: тесты Qwen 32B и 7B Coder — тройное повышение качества и аппетиты к памяти
Это вторая часть статьи о форке llama.cpp, добавляющем рекурсивный режим обработки. Автор протестировал Qwen 32B и Qwen 2.5 Coder 7B на RTX 3050 6 ГБ, сравнив стандартный движок (D=0) с улучшенным форком (D=12). Рекурсивный движок значительно улучшил качество кода (до 3.1 раза больше корректных исправлений), но стоил около 11-13% скорости генерации и увеличил использование видеопамяти.
Автор статьи продолжает тестирование форка llama.cpp, в котором реализован рекурсивный режим (обозначается как D=12), против стандартного движка (D=0). Тесты проводились на видеокарте RTX 3050 6 ГБ, все модели в квантизации Q4. Для большой модели Qwen 32B-A3B на простых задачах бенчмарка оба движка показали идентичные результаты, но рекурсивная версия была немного медленнее. На сложном сегменте
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
