Nghiên cứuTác tử 🇺🇸 27.07.2026 16:04

ConvApparel: Đo lường và thu hẹp khoảng cách hiện thực trong các trình mô phỏng người dùng dựa trên LLM

Google/DeepMindGoogle/DeepMind
Google Research giới thiệu ConvApparel, một bộ dữ liệu hội thoại người-AI mới và khung đánh giá ba trụ cột để định lượng và giảm 'khoảng cách hiện thực' trong các trình mô phỏng người dùng dựa trên mô hình ngôn ngữ lớn. Khung đánh giá bao gồm thống kê cấp độ dân số, điểm giống người và xác thực phản thực tế, được áp dụng cho các trình mô phỏng xây dựng với mô hình Gemini. Kết quả cho thấy các trình mô phỏng dựa trên dữ liệu (ICL, SFT) vượt trội hơn so với các trình dựa trên lời nhắc, nhưng ngay cả các mô hình tốt nhất vẫn thể hiện các hiện tượng giả tạo tinh vi.
Google Research的研究员Ofer Meshi和Sally Goldman推出了ConvApparel,这是一个新的数据集和评估框架,旨在衡量并提升基于大语言模型的用户模拟器的真实感。该数据集包含超过4000轮人机多轮对话(近15000轮),覆盖服装购物领域,采用双代理协议收集,用户被随机分配至乐于助人的“好”代理或故意不帮忙的“坏”代理。该框架包含三个支柱:群体级统计、通过自动判别器进行的人类相似度评分,以及反事实验证。利用Gemini模型系列,测试了三种模拟器:提示基线、基于检索增强生成(RAG)的上下文学习(ICL)模拟器,以及监督微调(SFT)模拟器。结果显示,数据驱动的模拟器(ICL和SFT)优于提示基线,在群体级测试中紧密模仿人类行为,但所有模拟对话均被人类相似度判别器自信地识别为合成。反事实验证表明,ICL和SFT模拟器能适应未见过的“坏”代理,表现为挫败感增加,而提示基线则保持异常礼貌。该研究强调了持续存在的真实感差距,并提供了弥合该差距的工具。
Nguồn: Google Research — bản gốc
Bài viết liên quan trước đây ↓
Tin mới