RTX 3050 上的递归 llama.cpp 引擎:Qwen 32B 与 7B Coder 测试——质量提升 3 倍及内存需求
Mistral
这是关于 llama.cpp 一个分支的第二部分文章,该分支增加了递归处理模式。作者在 RTX 3050 6 GB 上测试了 Qwen 32B 和 Qwen 2.5 Coder 7B,比较了标准引擎(D=0)与改进后的分支(D=12)。递归引擎显著提高了代码质量(正确修复最多提升 3.1 倍),但生成速度降低了约 11-13%,并且增加了显存占用。
文章作者继续测试llama.cpp的一个分支,该分支实现了递归模式(指定为D=12),并与标准引擎(D=0)进行对比。测试在一块RTX 3050 6GB显卡上进行,所有模型均采用Q4量化。对于大型Qwen 32B-A3B模型,在简单基准任务上,两个引擎产生了相同的结果,但递归版本稍微慢一些。在困难部分,递归引擎在代码审查任务中修复了将近3.1倍多的错误,尽管耗时增加了17%。作者指出,递归引擎解决了“懒惰代码生成”的问题,生成了完整的整体脚本,而不是零散的代码片段。对于Qwen 2.5 Coder 7B Instruct,递归版本在代码审查中表现更好(多发现了一个错误),在全栈开发方面完全满足了需求,而标准版本则没有,在2D游戏测试中两者打成平手,递归引擎避免了不存在的标签并实现了基本的游戏逻辑。对于Mistral 7B Instruct v0.2,递归引擎显著提高了安全性(98%受保护),大幅改进了全栈平台(改进2.2倍,100%的业务逻辑),并生成了更干净的游戏布局。主要缺点是速度降低了约13%,并且VRAM消耗增加。作者在文章中提供了分支仓库和包含详细结果的Google Drive链接。
来源: Habr — хаб ИИ —
原文
