研究人员创建83亿虚拟人替我们测试产品
OpenAI
Anthropic
哈佛大学和麻省理工学院的研究人员展示了MatrAIx系统,该系统利用基于83亿个人物画像的AI代理作为测试对象。该系统可以模拟用户在网站、应用程序和调查中的行为,但人物群体并不代表全人类,且结果可能因底层人工智能模型的不同而有显著差异。
MatrAIx于2026年8月4日提交至arXiv的一篇论文中提出,旨在利用充当虚拟用户的AI代理实现产品测试自动化。Persona 8B数据库包含83亿个画像,每个画像由多达1290个特征描述,但已发布的过滤样本包含999,847个画像。该系统提供四种测试环境:问卷调查、聊天机器人对话、网站浏览和应用交互。研究人员使用GPT-5.5、Claude Opus 4.8和Claude Haiku 4.5进行了18,189次试验,发现结果很大程度上取决于底层模型——例如,不同模型间支付意愿的差异从23.2%到93.9%不等。作者承认这些画像属于模拟工具,而非代表性样本,并警告防止滥用,如针对性的说服或价格歧视。
来源: Numerama —
原文
