AI検出器に引っかからなかったテキスト:ロシア語テキストを使った実験
Anthropic
Moonshot AI
OpenAI
DeepSeek
Сбер
Яндекс
Text.ru
GPTZero
6つの大規模言語モデルが生成したテキストと人間が書いたロシア語テキストを、4つのAI検出器を使ってテストする実験が行われました。その結果、検出器は短いテキストを苦手とし、特定のモデルに対して「盲点」があることが明らかになりました。この記事では、AI検出の背後にある原理と、その精度をめぐる論争について論じています。
HabrのAIハブに関する記事では、AI生成コンテンツの台頭とAI検出器の普及について探求しています。記事は、2024年11月にAI生成テキストが人間が書いたテキストの数を上回ったことを示すGraphiteの調査に言及し、2026年春に更新された調査では同等になったと主張しています。著者は、典型的な検出器がどのように機能するかを説明し、例としてYandexのNeurodetectorとText.ruのAI検出器を挙げ、OpenAIが精度の低さから2023年に自社の分類器を閉鎖したことに言及しています。SberのGigaCheckは、微調整されたMistralモデルに基づいており、94.7%の精度を主張しています。実験では、4つの検出器(Yandex Neurodetector、GigaCheck、Text.ru AI検出器、GPTZero)と6つの大規模言語モデル(LLM)(Claude Opus 5、Kimi K3、GPT-5.6 Sol、GLM 5.2、DeepSeek V4 Pro、GigaChat 3.5 Ultra)を使用しました。2021年より前に公開されたパングラムに関する3つの人間が書いたテキストが対照群として機能しました。モデルは同様の長さのテキストを生成し、すべてのテキストは各検出器で一度ずつチェックされました。結果はAI/HUMANカテゴリに正規化されました。著者は、サンプルサイズの小ささ、単一回の実行、2026年7月27日という日付などの限界を認めています。調査結果は、長いテキストの方が正確に分類される一方、短いテキストではエラーが発生しやすいことを示しています。特に、Yandex NeurodetectorがClaude Opus 5のテキスト3件を人間のものと誤分類し、Text.ruがGPT-5.6 Solのテキストを誤って人間のものとフラグ付けし、「盲点」を示唆しています。記事は、どの検出器も推奨することを控えています。
出典: Habr — хаб ИИ —
原文
