读者在得知AI来源前,对ChatGPT故事的评价高于人类作品
OpenAI
一项新研究显示,读者无法区分ChatGPT生成的短篇小说与人类创作的短篇小说,甚至在质量和沉浸感方面给予AI文本更高评分——但仅在他们认为这些故事由人类撰写时如此。该研究涉及三项实验,超过2500名参与者,结果发表在《判断与决策》期刊上。
根据悉尼·西尔斯(Sydney Sears)和迪娜·斯科尔尼克·韦斯伯格(Deena Skolnick Weisberg)发表在《判断与决策》(Judgment and Decision Making)期刊上的一项研究,读者无法分辨一篇短篇小说是由人类撰写还是由ChatGPT生成。在三项涉及超过2500名参与者的实验中,受试者在区分人类创作和AI生成的虚构短篇小说方面,其表现并不优于随机猜测。在第一项实验中,1682名参与者每人阅读了六篇故事中的一篇,其中三篇来自文学杂志,三篇使用ChatGPT 4.0生成,提示词基于人类原作的题材、风格和叙事视角。一半参与者被告知故事由人类撰写,另一半则被告知来自ChatGPT。AI生成的故事在感知质量和沉浸感方面得分显著更高(平均质量1.54对0.97;沉浸感1.42对1.00)。然而,无论实际作者是谁,被告知故事为人类撰写的参与者对其评价更高。对AI持积极态度的参与者普遍给出更高评分,且当被告知故事来自ChatGPT时,他们的评分进一步提高,而怀疑AI的参与者则表现出相反的效果。在另外两项涉及905名参与者的实验中,每位参与者同时阅读人类和AI创作的故事,并需辨别出哪个是哪个,但他们的表现依然不优于随机猜测。自我报告的使用AI系统的经验与正确归因呈正相关,而阅读小说的经验则无助于此。作者认为,AI文本通常更流畅、更易理解、情感上更积极,这可能解释了为何其获得更高评分,但这并不意味着文学上更优秀,因为高质量的小说往往故意具有挑战性。研究人员得出结论,AI能够创作出被认为至少与人类作品相当的作品,但人们并不将其归功于AI。数据和材料可在开放科学框架(Open Science Framework)上公开获取。
来源: The Decoder (DE) —
原文
