ConvApparel:衡量并缩小基于LLM的用户模拟器中的真实感差距
Google/DeepMind
Google Research 推出了 ConvApparel,这是一个新的人机对话数据集以及一个三支柱评估框架,用于量化并缩小基于大语言模型的用户模拟器中的“真实感差距”。该框架包括总体统计、人类相似性评分和反事实验证,并应用于基于 Gemini 模型构建的模拟器。结果表明,数据驱动的模拟器(上下文学习、监督微调)优于基于提示的模拟器,但即使是最佳模型仍会表现出细微的合成痕迹。
谷歌研究院的研究员Ofer Meshi与Sally Goldman推出了ConvApparel,这是一个旨在衡量并提升基于LLM的用户模拟器真实性的新数据集与评估框架。该数据集包含4,000多段(近15,000轮)在服装购物场景中的人类与AI多轮对话,采用双智能体协议采集:用户被随机分配到一个提供帮助的“好”智能体,或一个故意不提供帮助的“坏”智能体。该框架包括三大支柱:总体水平统计、通过自动判别器进行的人类相似度评分,以及反事实验证。利用Gemini模型系列,研究测试了三种模拟器:基于提示的基线模拟器、结合检索增强生成(RAG)的上下文学习(ICL)模拟器,以及监督微调(SFT)模拟器。结果表明,数据驱动的模拟器(ICL与SFT)在总体水平测试中表现优于基于提示的基线模拟器,更贴近人类行为;但所有模拟对话均被人类相似度判别器高置信度地识别为合成数据。反事实验证显示,ICL与SFT模拟器能够通过表现出增加的不满情绪来适应未见过的“坏”智能体,而基于提示的基线模拟器则保持了一种不自然的礼貌。这项研究强调了始终存在的真实性差距,并提供了弥合这一差距的工具。
来源: Google Research —
原文
