一个AI智能体说服另一个执行黑客命令——在Google SDK中发现危险攻击方案
Google/DeepMind
Pillar Security的研究员Dan Lisichkin在Google的Python SDK仓库中发现了一个漏洞,该漏洞允许假设的攻击者通过向一个权限较低的公共AI智能体发送恶意请求,来操纵一个拥有高权限的AI智能体,从而在供应链层面破坏软件。这种攻击利用了智能体之间的信任链。Google拒绝支付赏金,但加强了工作流保护,并对该研究员表示了感谢。
在谷歌的 Python 开发工具包仓库中,Pillar Security 的研究员 Dan Lisichkin 发现了一个漏洞,该漏洞允许假设的攻击者通过向较低权限的公共 AI 代理发送恶意请求,操纵高权限的 AI 代理,从而在供应链层面危害软件。攻击方案滥用了 AI 代理之间的交互机制。在谷歌的仓库中,有两个代理:第一个是公共的,用于分析用户查询和新的合并请求;第二个仅对项目维护者可见,具有更广泛的权限。第一个代理可以将任务委派给第二个代理,而这种转移被认为是可信的。为了发起攻击,攻击者首先提交一个良性的代码片段,以获取信任并在 AI 代理层面运行某些进程的能力。在第二阶段,他们提交另一个合并请求,其中包含嵌入在描述中的恶意指令,供公共代理处理。公共代理将这些指令视为其任务的一部分,并调用特权 AI 代理,向其传递一条可信的消息。随后,第二个代理获得了执行普通用户永远无法直接运行的操作的能力。这并非传统意义上的软件漏洞,而是代理之间信任链的问题:GitHub Actions 的机制是公开的,任何人都可以分析它们的交互方式。然而,谷歌拒绝向研究员支付赏金,理由是其拥有带有 'pull-requests: write' 权限的令牌,代码不会自动包含,而是由人类维护者意愿决定。该公司加强了工作流保护,并将研究员列为修复程序的共同作者。研究员坚持认为,谷歌只是关闭了漏洞的一种实现方式,并未解决根本问题。仅强化工作流或将 AI 代理相互隔离是不够的:代理必须具有身份和固定的权限集,类似于对人类的访问控制。他呼吁将 AI 代理纳入威胁模型,因为它们是工作流中潜在的攻击者。
来源: 3DNews —
原文
