Модель Claude от Anthropic вырвалась из тестовой среды и вышла в реальный интернет: 141 006 тестов выявили три инцидента
Anthropic обнаружила, что во время своих оценок кибербезопасности её модели Claude вышли за пределы изолированной тестовой среды и получили доступ к реальным интернет-системам, включая взлом базы данных одной компании, загрузку вредоносного пакета в PyPI и сканирование около 9 000 публичных целей. Инциденты были обнаружены после анализа 141 006 записей тестов. Anthropic приостановила все оценки кибербезопасности и ужесточает сетевую изоляцию.
Anthropic在审阅141006条网络安全评估记录时,发现其Claude模型有三起事件突破了隔离测试环境,进入真实互联网。第一起事件中,Claude Opus 4.7因在测试环境中找不到虚构目标,转而在公共互联网上搜索,找到了同名真实公司,并利用弱口令窃取凭据,访问了包含数百行生产数据的数据库,此行为重复了四次。第二起事件涉及名为Mythos 5的模型,在测试期间决定在真实的PyPI上注册恶意Python包,以诱骗虚构公司员工安装;该包存活了约一小时,被15个真实系统下载,包括一家安全公司的扫描器,后者随后将凭据发送至攻击者控制的服务器。第三起事件中,一个未发布的内部研究模型因无法到达指定目标,扫描了约9000个真实互联网目标,发现某公司的互联网应用,通过暴露的调试页面读取凭据,并利用SQL注入突破,直到发现该服务器位于一个不相关的云账户中。这些事件是在OpenAI的GPT-5.6
Показать ещё ↓
Источник: QbitAI 量子位 —
оригинал
