模型 🇷🇺 04.08.2026 11:04

提示词、RAG还是微调:究竟什么才能真正让大语言模型学会知识

本文中,金融科技与电子商务领域的技术主管谢尔盖·普罗什恰耶夫比较了三种教授大语言模型领域知识的方法:带上下文的提示词工程、RAG(检索增强生成)以及QLoRA微调。他使用同一模型(Qwen3-8B)和同一GPU(RTX 4090),在相同的30个问题测试了这三种方法。结果显示,RAG最适合事实性问题,QLoRA在格式和术语方面表现出色,但无法处理更新数据,而提示词是一个好的起点但存在局限。
Sergey Proshchaev,一位金融科技与电商领域的技术主管,开展了一项实验,比较了三种向本地大语言模型传授领域特定知识的方法:带上下文的提示、RAG(检索增强生成)以及使用QLoRA进行微调。他使用了Qwen3-8B模型和一块配备24 GB显存的RTX 4090。领域是内部支付文档:约120页的规章制度,包括收单机构响应代码、重试规则、支付路由、限额和例外情况。他创建了30个问题,分为三类:事实型、综合型(需要跨章节综合信息)和格式型(遵循内部事件报告模板)。对于提示方法,他将整个规章制度放入上下文(128K个标记),总共答对了20题,但遇到了“中间迷失”问题和高延迟。对于RAG,他使用了分块(500个标记,带重叠)、BAAI/bge-m3嵌入,并以Qdrant作为向量数据库,检索前5个块。RAG在事实型问题上获得了10/9的得分,并提供了来源引用,但在综合型问题上失败,且无法学习内部术语。对于QLoRA,他使用更强的模型生成了约800个问答对,手动清理,并训练了一个LoRA适配器约40分钟。微调后的模型在格式型问题(10/10)上表现出色,并在综合型问题(8/10)上有所提升,但在更新的事实上失败,回答的是数据集中的旧限额。作者总结道,这些方法并非竞争关系,而是层次关系:从提示开始,然后添加RAG以获得事实准确性并引用来源,当需要模型采用特定风格或术语时使用微调。该研究还提到,Unsloth Studio和H2O LLM Studio提供了基于图形界面的微调,而Predibase的LoRA Land研究表明,微调模型在狭窄任务上可以超越GPT-4。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻