硬件与推理开源 🇷🇺 06.08.2026 00:03

递归llama.cpp分支上的Bonsai-27B:在RTX 3050上的完整设置与真实基准测试

cubetitled-uicubetitled-ui
这篇关于递归llama.cpp分支的第三篇文章涵盖了在弱GPU上运行混合Bonsai-27B模型(Delta-Net线性架构),展示了在密码算术任务上深度D=0与D=12的真实基准测试。启用递归(D=12)后,模型解决了SEND+MORE=MONEY问题,而基础引擎则失败。文中提供了设置命令和递归环境变量。
作者介绍了其关于 llama.cpp 递归分支系列文章的第三部分,重点介绍了 Bonsai-27B,这是一种混合模型,包含线性 Delta-Net 层和全注意力层。递归仅应用于全注意力层。该模型在 Q1_0 量化下约为 3.5 GB,可装入 6 GB 显存。文章提供了 CUDA 和 CPU 的构建说明,以及使用命令,包括环境变量 RECURRENT_D(深度:0、12、24)、RECURRENT_LAYERS_COUNT 和 RECURRENT_KV。在 NVIDIA RTX 3050 移动版 6 GB 上,使用种子 42 和温度 0.3,对密码算术谜题 SEND+MORE=MONEY 进行了真实基准测试,token 限制为 7000。D=0 生成了 7000 个 token,未能解出,达到了长度限制(finish_reason:length)。D=12 生成了 6594 个 token,正确解出了谜题,S=9,E=5,N=6,D=7,M=1,O=0,R=8,Y=2,验证 9567+1085=10652,并正确停止(finish_reason:stop)。两者的生成时间约为 5.5 分钟,速度分别为 21.1 token/秒(D=0)和 19.8 token/秒(D=12),速度下降约 6%。文章指出,递归不会改变权重,只改变推理计算图,并列出了兼容模型,包括 Qwen3.5、Qwen2、Gemma 2、Mistral 3 和 Delta-Net(Bonsai)。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻