大语言模型聊天机器人缺失的是什么:目标感
OpenAI
Meta
现代大语言模型聊天机器人擅长一次性查询,但在多轮对话中容易失去焦点。研究表明,模型在仅几轮对话后就会迅速偏离系统提示。作者提出了一种“目标驱动对话”方法,该方法考虑了长期目标和迭代交互。
大语言模型(LLM, Large Language Model)聊天机器人的性能在不断提升,但衡量其进步的基准测试——如MMLU、HumanEval和MATH——考察的都是一问一答式的单轮响应能力。然而,诸如旅行规划或GitHub问题自动化处理这类现实任务,往往需要通过多轮对话来逐步细化需求。研究人员发现,即便是LLaMA2-chat-70B和GPT-3.5-turbo-16k这样的先进模型,在对话进行到约1600个token(大约16轮)之后,也会开始偏离系统提示的约束。这一现象在一项实验中得到了印证:研究人员让两个LLM智能体相互对话,随后检验它们各自遵循指令的程度。
问题的根源在于,基于人类反馈的强化学习(RLHF, Reinforcement Learning from Human Feedback)训练方式并未考虑多步规划——它优化的是单轮响应,而非长期目标。作者提出了一种“目标导向对话”的方法,让聊天机器人扮演助手的角色,通过对话逐步厘清用户的真实意图。此类系统的例子包括“解决方案导向对话”,以及用于建模协作决策过程的Sotopia平台。要打造真正的智能助手,我们需要的不仅仅是生成文本,而是要将对话设计成一场目标导向的博弈,其中每一句话都会改变对话另一方的世界模型。
来源: The Gradient —
原文
