Uw tekst doorstond de AI-detector niet: een experiment met Russischtalige teksten
Anthropic
Moonshot AI
OpenAI
DeepSeek
Сбер
Яндекс
Text.ru
GPTZero
In een experiment werden vier AI-detectoren getest op teksten die zijn gegenereerd door zes grote taalmodellen en door mensen geschreven teksten in het Russisch. De resultaten tonen aan dat de detectoren moeite hebben met korte teksten en 'blinde vlekken' vertonen bij bepaalde modellen. Het artikel bespreekt de principes achter AI-detectie en de controverse over de nauwkeurigheid ervan.
Het artikel van Habr's AI-hub verkent de opkomst van AI-gegenereerde content en de proliferatie van AI-detectoren. Het wijst op een onderzoek van Graphite waaruit bleek dat in november 2024 AI-gegenereerde teksten menselijke teksten overtroffen, terwijl een bijgewerkt onderzoek in het voorjaar van 2026 beweerde dat er sprake was van gelijkwaardigheid. De auteur beschrijft hoe typische detectoren werken, met verwijzing naar Yandex's Neurodetector en Text.ru's AI-detector als voorbeelden, en vermeldt dat OpenAI in 2023 zijn classificator heeft stopgezet vanwege lage nauwkeurigheid. Sber's GigaCheck, gebaseerd op een fijn afgesteld Mistral-model, claimt een nauwkeurigheid van 94,7%. Het experiment gebruikte vier detectoren (Yandex Neurodetector, GigaCheck, Text.ru AI-detector, GPTZero) en zes grote taalmodellen (Claude Opus 5, Kimi K3, GPT-5.6 Sol, GLM 5.2, DeepSeek V4 Pro, GigaChat 3.5 Ultra). Drie door mensen geschreven teksten over pangrams, gepubliceerd vóór 2021, dienden als controle. De modellen genereerden teksten van vergelijkbare lengtes, en alle teksten werden één keer door elke detector gecontroleerd. De resultaten werden genormaliseerd naar AI/MENS-categorieën. De auteur erkent beperkingen: kleine steekproef, eenmalige uitvoering, en de datum van 27 juli 2026. Bevindingen geven aan dat langere teksten nauwkeuriger worden geclassificeerd, terwijl korte teksten meer fouten veroorzaken. Opvallend is dat Yandex Neurodetector drie Claude Opus 5-teksten als menselijk classificeerde, en Text.ru ten onrechte GPT-5.6 Sol-teksten als menselijk markeerde, wat wijst op 'blinde vlekken'. Het artikel beveelt geen enkele detector aan.
Bron: Habr — хаб ИИ —
origineel
