KI-SicherheitForschung 🇷🇺 02.08.2026 00:03

Ihr Text ist durch den KI-Detektor gefallen: Ein Experiment mit russischsprachigen Texten

AnthropicAnthropic Moonshot AIMoonshot AI OpenAIOpenAI DeepSeekDeepSeek СберСбер ЯндексЯндекс Text.ruText.ru GPTZeroGPTZero
Ein Experiment testete vier KI-Detektoren gegen Texte, die von sechs großen Sprachmodellen generiert wurden, sowie gegen von Menschen verfasste Texte auf Russisch. Die Ergebnisse zeigen, dass Detektoren bei kurzen Texten Schwierigkeiten haben und 'blinde Flecken' für bestimmte Modelle aufweisen. Der Artikel diskutiert die Prinzipien hinter der KI-Erkennung und die Kontroverse um ihre Genauigkeit.
Der Artikel aus dem KI-Hub von Habr befasst sich mit dem Aufstieg von KI-generierten Inhalten und der Verbreitung von KI-Detektoren. Es wird auf eine Studie von Graphite hingewiesen, die zeigt, dass im November 2024 KI-generierte Texte menschlich geschriebene zahlenmäßig übertrafen, während eine aktualisierte Studie im Frühjahr 2026 von einer Gleichwertigkeit spricht. Der Autor beschreibt, wie typische Detektoren funktionieren, und nennt als Beispiele den Neurodetektor von Yandex und den KI-Detektor von Text.ru. Außerdem erwähnt er, dass OpenAI seinen Klassifikator im Jahr 2023 wegen geringer Genauigkeit abgeschaltet hat. Die GigaCheck von Sber, die auf einem fein abgestimmten Mistral-Modell basiert, beansprucht eine Genauigkeit von 94,7 Prozent. Das Experiment verwendete vier Detektoren (Yandex Neurodetektor, GigaCheck, den KI-Detektor von Text.ru und GPTZero) sowie sechs Large Language Models (Claude Opus 5, Kimi K3, GPT-5.6 Sol, GLM 5.2, DeepSeek V4 Pro und GigaChat 3.5 Ultra). Drei menschlich geschriebene Texte über Pangramme, die vor 2021 veröffentlicht wurden, dienten als Kontrolle. Die Modelle generierten Texte ähnlicher Länge, und alle Texte wurden einmal von jedem Detektor überprüft. Die Ergebnisse wurden auf die Kategorien KI/MENSCH normalisiert. Der Autor räumt Einschränkungen ein: kleine Stichprobe, einmaliger Durchlauf und das Datum des 27. Juli 2026. Die Ergebnisse zeigen, dass längere Texte genauer klassifiziert werden, während kurze Texte mehr Fehler verursachen. Bemerkenswert ist, dass der Yandex Neurodetektor drei Texte von Claude Opus 5 fälschlicherweise als menschlich einstufte und Text.ru GPT-5.6 Sol-Texte fälschlicherweise als menschlich markierte, was auf 'blinde Flecken' hindeutet. Der Artikel enthält sich einer Empfehlung für einen bestimmten Detektor.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten