Lezers waarderen ChatGPT-verhalen hoger dan menselijke, totdat ze de AI-oorsprong ontdekken
OpenAI
Een nieuwe studie toont aan dat lezers korte verhalen gegenereerd door ChatGPT niet kunnen onderscheiden van door mensen geschreven verhalen, en de AI-teksten zelfs beter beoordelen op kwaliteit en onderdompeling—maar alleen zolang ze geloven dat de verhalen door een mens zijn geschreven. De studie omvatte meer dan 2500 deelnemers in drie experimenten, met resultaten gepubliceerd in het tijdschrift Judgment and Decision Making.
Volgens een onderzoek van Sydney Sears en Deena Skolnick Weisberg, gepubliceerd in het tijdschrift Judgment and Decision Making, kunnen lezers niet onderscheiden of een kort verhaal door een mens of door ChatGPT is geschreven. In drie experimenten met meer dan 2500 deelnemers presteerden proefpersonen niet beter dan kans bij het onderscheiden van door mensen geschreven en door AI gegenereerde fictieve korte verhalen. In het eerste experiment las elk van de 1682 deelnemers een van zes verhalen, drie uit literaire tijdschriften en drie gegenereerd met ChatGPT 4.0, met prompts die waren gebaseerd op thema, stijl en vertelperspectief van de menselijke originelen. De helft kreeg te horen dat het verhaal door een mens was geschreven, de andere helft dat het van ChatGPT kwam. Door AI gegenereerde verhalen scoorden significant hoger op waargenomen kwaliteit en onderdompeling (gemiddelde kwaliteit 1,54 versus 0,97; onderdompeling 1,42 versus 1,00). Deelnemers die te horen kregen dat een verhaal door een mens was geschreven, beoordeelden het echter hoger, ongeacht de werkelijke auteurschap. Degenen met een positieve houding ten opzichte van AI gaven over het algemeen hogere beoordelingen, en hun beoordelingen stegen verder wanneer ze te horen kregen dat het verhaal van ChatGPT kwam, terwijl AI-sceptische deelnemers het tegenovergestelde effect vertoonden. In twee verdere experimenten met 905 deelnemers lazen ze zowel menselijke als AI-verhalen en moesten ze identificeren welke welke was, maar ze waren nog steeds niet beter dan kans. Zelfgerapporteerde ervaring met AI-systemen correleerde positief met correcte toeschrijving, terwijl ervaring met fictie niet hielp. De auteurs suggereren dat AI-teksten typisch vloeiender, gemakkelijker te begrijpen en emotioneel positiever zijn, wat de hogere beoordelingen kan verklaren zonder literair beter te zijn, aangezien kwaliteitsfictie vaak opzettelijk uitdagend is. De onderzoekers concluderen dat AI creatieve werken kan produceren die als ten minste gelijkwaardig aan menselijk werk worden ervaren, maar mensen erkennen dat niet aan AI toe. Gegevens en materialen zijn openlijk beschikbaar op het Open Science Framework.
Bron: The Decoder (DE) —
origineel
