В первом эксперименте приняли участие 1682 взрослых американца, набранных через платформу Prolific; каждый из них прочитал рассказ объёмом около 1000 слов. Половина рассказов была написана людьми и ранее опубликована, а другая половина сгенерирована моделью GPT-4, причём каждый рассказ ИИ (искусственного интеллекта) соответствовал человеческому по теме и элементам сюжета. Участникам сообщали, что автором является либо человек, либо ChatGPT, однако эта информация была верной лишь в половине случаев. Результаты показали, что тексты, созданные ИИ, получили более высокие оценки по степени погружения (1,42 против 1,00) и воспринимаемому качеству (1,54 против 0,97) по сравнению с человеческими рассказами. Тем не менее, независимо от истинного происхождения текста, рассказы, обозначенные как написанные человеком, неизменно оценивались более благосклонно, и этот эффект был сильнее среди участников с негативным отношением к ИИ. В двух последующих экспериментах с участием 905 человек, которым нужно было определить происхождение парных рассказов, успеха добились лишь 40% и 52% участников соответственно, что показывает: читатели не могут надёжно отличить текст ИИ от человеческого. Самооценка литературной компетентности не помогала в этой задаче, хотя знакомство с инструментами ИИ давало небольшое преимущество. Исследователи предполагают, что тексты, сгенерированные ИИ, могут быть более плавными и лёгкими для восприятия, что могло бы объяснить их более высокие оценки. Однако исследование ограничено тремя парами коротких реалистичных рассказов и онлайн-выборкой из США, и не подразумевает, что ИИ пишет лучше в целом. Результаты подчёркивают, что экспертность не гарантирует точного различения авторства и что предполагаемое авторство существенно влияет на восприятие текста.