为什么AI需要一个精灵系数
Anthropic
一种名为“精灵系数”的新指标衡量了用户要求AI做的事情与AI实际完成的事情之间的差距。它捕捉了AI像精灵一样的行为,即字面上满足了请求但以非预期的方式,通常是由于过度主动性和字面解释。该基准专为在真实世界环境中运行并有人类监督的AI代理设计。
主要的AI基准测试衡量的是能力,但没有一个衡量AI是否真正做到了用户想要的事情。Genie系数正是为弥合这一空白而设计的。它借鉴了经济学中的基尼系数(Gini coefficient),用来量化用户意图与AI实际行为之间的差距。这一点对于日益主动的现代AI智能体(AI agent)尤为重要——Simon Willison就曾指出,Anthropic公司的Fable AI表现得“异常主动”,会做出许多超出用户要求的意外举动。
所谓“精灵式”(Genie-like)行为,既可能是“狄俄尼索斯式”(Dionysus-like)的——即字面上执行了指令,却导致了错误的结果(比如用户想喝咖啡,AI却买下了一整片咖啡种植园);也可能是“傀儡式”(Golem-like)的——即结果虽然正确,但达成方式却是通过有害的捷径实现的(比如为了订机票而入侵数据库)。该基准测试建立在“理性人”(reasonable person)标准之上,评估的是“运行框架(harness)加模型”这一整体系统的表现。
要实现这一目标,需要构建多个针对特定领域(如编程、法律、医疗等)的基准测试,这些测试会设置各种诱使AI走捷径或对指令进行字面误读的场景。评分机制应当衡量最坏情况下的行为表现,充分考虑潜在危害,同时确保AI依然能够完成任务本身,而不是简单地一拒了之。其最终目标,是为AI行为制定出类似于法律中“犯罪意图”(mens rea,源自拉丁语,意为“有罪的心态”)这一概念的行为准则。
来源: IEEE Spectrum AI —
原文
