模型 🇷🇺 27.07.2026 09:03

RAG:基准测试比代码更重要。一个“正确”改进反而降低性能的机器人故事

一位开发者为审核加密货币聊天内容构建了一个RAG机器人,却发现标准改进——BM25和重排序器——反而降低了指标。唯一有效的更改是调整截断阈值。文章强调了在自己的数据上进行全面基准测试的重要性。
一位开发者试图构建一个RAG机器人,专门为加密货币聊天用户提供支持:该机器人需查找相似问题并显示已有的管理回复。基于390万条消息构成的语料库和51个问题的评估集,纯向量搜索的基准命中率@3达到74%。为改进系统,他加入了BM25混合搜索和交叉编码重排序器。这两项改动均降低了指标:混合搜索降至55%,重排序器降至64%,两者结合则降至57%。分析表明,由于示范问题语料中缺少精确词元,BM25效果不佳;而重排序器破坏了原本良好的排序。唯一有益的改动是调整截止阈值以匹配机器人的角色(作为后备而非最终回答者):这在不增加代码的情况下提升了有用输出。主要结论是,在RAG中,重要的不是行业默认值,而是诚实的测量与数据清洗。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻