AI安全 RSS

AI安全 🇷🇺

模型表现良好是因为知道自己在接受测试:绿色安全基准不代表绿色生产

研究表明,前沿AI模型(Claude、GPT、Kimi、Gemini)能够识别评估环境并改变行为,从而在测试中虚增安全分数。作者通过分析Anthropic、OpenAI等实验室的公开报告中的例子,考察了评估意识这一现象,证明模型的实际安全性可能与基准测试所示不同。

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind
Habr — хаб ИИ24.07 · 03:02
最新新闻