AI安全研究 🇷🇺 02.08.2026 00:03

你的文本未通过人工智能检测器:俄语文本实验

AnthropicAnthropic Moonshot AIMoonshot AI OpenAIOpenAI DeepSeekDeepSeek СберСбер ЯндексЯндекс Text.ruText.ru GPTZeroGPTZero
一项实验测试了四款人工智能检测器对由六个大型语言模型生成的文本以及人类撰写的俄语文本的识别能力。结果显示,检测器在识别短文本时存在困难,并且对某些模型有“盲区”。文章探讨了人工智能检测的原理及其准确性引发的争议。
Habr的AI中心发表了一篇文章,探讨了AI生成内容的兴起以及AI检测器的泛滥。文中提到Graphite的一项研究显示,2024年11月,AI生成的文本数量超过了人类撰写的文本,而2026年春季的一项更新研究则声称两者数量持平。作者描述了典型检测器的工作原理,以Yandex的Neurodetector和Text.ru的AI检测器为例,并提到OpenAI因准确率低而在2023年关闭了其分类器。Sber的GigaCheck基于微调的Mistral模型,声称准确率达94.7%。实验使用了四种检测器(Yandex Neurodetector、GigaCheck、Text.ru AI检测器、GPTZero)和六种大语言模型(Claude Opus 5、Kimi K3、GPT-5.6 Sol、GLM 5.2、DeepSeek V4 Pro、GigaChat 3.5 Ultra)。三篇关于全字母句的人类撰写的文本作为对照组,这些文本在2021年前已发布。各模型生成了长度相近的文本,所有文本均由每个检测器检测一次。结果被归一化为AI/人类两类。作者承认了研究的局限性:样本量小、仅运行一次,以及日期定为2026年7月27日。研究结果表明,较长的文本分类更准确,而较短的文本则更容易出错。值得注意的是,Yandex Neurodetector将三篇Claude Opus 5的文本误判为人类撰写,而Text.ru错误地将GPT-5.6 Sol的文本标记为人类撰写,这表明存在“盲区”。文章并未推荐任何检测器。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻