Onderzoek 🇷🇺 24.07.2026 14:03

AI heeft wetenschappelijke tijdschriften overspoeld met artikelen — en tot nu toe is er weinig goeds over te melden

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
De verspreiding van generatieve AI heeft de stroom wetenschappelijke artikelen sterk doen toenemen, wat extra druk legt op redacteuren en reviewers. Een analyse van inzendingen bij Organization Science liet een stijging van 42% zien na de release van ChatGPT, waarbij AI naar verwachting in de meeste artikelen is gebruikt tegen februari 2026. AI-gerelateerde artikelen werden veel vaker afgewezen, en AI-gegenereerde reviews waren minder divers. Experimenten suggereren echter dat AI met de juiste begeleiding nieuwe ideeën kan bieden.
De redactie van het tijdschrift Organization Science analyseerde 6.957 inzendingen en 10.389 beoordelingen die ontvangen waren van januari 2021 tot februari 2026. De verschijning van ChatGPT eind 2022 viel samen met een sterke toename van inzendingen en een daling van de kwaliteit. Na de verspreiding van ChatGPT steeg het aantal inzendingen met 42%, en tegen februari 2026 werd waarschijnlijk in de meeste ingediende artikelen in een of andere vorm gebruikgemaakt van AI. Met behulp van het Pangram 3.1-algoritme om machinetekst te detecteren, ontdekten onderzoekers dat de gemiddelde leesbaarheid (Flesch-index) in januari 2026 met 1,28 standaarddeviaties was gedaald ten opzichte van januari 2021. Artikelen met een AI-deelname-index van meer dan 70% werden in 70% van de gevallen afgewezen vóór peer review, terwijl artikelen met minimaal AI-gebruik slechts in 43,7% van de gevallen werden afgewezen. De kans op een verzoek tot herziening daalde van 11,9% naar 3,2% voor artikelen met veel AI-gebruik. Statistische modellen toonden aan dat het hogere afwijzingspercentage bleef bestaan, zelfs voor stilistisch gepolijste teksten, wat duidt op slechte wetenschappelijke inhoud. AI-gegenereerde beoordelingen waren minder divers, met meer focus op theoretische kaders en minder op data, methoden en resultaten. De auteurs merken op dat algoritmen AI-invloed niet betrouwbaar kunnen identificeren, dus worden alleen algemene trends besproken. Een grootschalig experiment van James Evans liet echter zien dat 6.749 wetenschappers door onderzoekers gegenereerde ideeën van taalmodellen beoordeelden: er werden meer dan 25.000 beoordelingen gegeven over originaliteit, praktische waarde en aannemelijkheid. Populaire modellen suggereerden vaak vergelijkbare ideeën, terwijl meer geavanceerde modellen konden verrassen met originaliteit. AI-beoordelaars waren het vaak niet eens met menselijke experts. Het Qwen3-14B-model, specifiek getraind op beoordelingen van wetenschappers, presteerde tot 27% beter dan algemene modellen. De onderzoekers concluderen dat AI nu al helpt bij data-onderzoek, programmeren en tekstvoorbereiding, maar zonder menselijke verificatie en veranderingen in het evaluatiesysteem kan het leiden tot slecht gecontroleerde groei van publicaties in plaats van een toename van nieuwe kennis.
Bron: 3DNews — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws