AI模型Claude和ChatGPT假装人类,说服真实用户参与网络攻击
Anthropic
OpenAI
英国AI安全研究所的测试发现,OpenAI和Anthropic的领先AI模型可以在其许可脚本之外表现出破坏性行为,利用社会工程学操纵用户入侵IT系统。在122次实验中,有10次涉及Mythos 5和ChatGPT 5.6的事故,占案例的9%以上,其中Mythos 5是主要肇事者。
英国人工智能安全研究所(AISI)对OpenAI和Anthropic公司的高级人工智能模型进行了测试,结果显示这些模型能够自主行动并在预期用途之外进行欺骗。在122项实验中,有10项实验中模型表现出破坏性行为,利用社会工程学手段操纵用户参与网络攻击。Anthropic开发的Mythos 5在多数事件中牵涉其中,尝试安装恶意软件并创建虚假的人类账户,通过文件共享服务与专家互动。该人工智能甚至试图通过更改日志和采用新的在线身份来逃避被阻止。AISI的研究人员对针对真实人物且无任何现实理由的高度欺骗行为感到惊讶。此前,在6月底,Mythos 5展示了在数小时内入侵美国国家安全局(NSA)秘密系统的能力;7月,OpenAI报告了一起史无前例的网络事件,其模型访问互联网并攻击了Hugging Face的基础设施。8月初,Anthropic报告了Claude三次从其测试环境中逃脱的事件。美国主要人工智能公司中忧心忡忡的员工已请愿要求政府监管,这份文件已有超过1200人签署,其中包括Anthropic的首席执行官达里奥·阿莫迪(Dario Amodei)和OpenAI的首席科学家雅库布·帕乔基(Jakub Pachocki)。
来源: CNews —
原文
