谷歌评估大语言模型行为倾向的一致性
Google/DeepMind
谷歌研究推出一个框架,将心理问卷转化为情境判断测试(SJTs),以评估大语言模型的行为对齐性。对25个模型的测试表明,较小的模型常常偏离人类共识,而较大的模型表现出改进但仍不完美的对齐性。研究还发现,当人类意见分歧时,模型会过度自信。
谷歌研究提出一个框架,通过将成熟的心理问卷改编为情境判断测试来评估大型语言模型的行为倾向。该框架在职业沉稳、冲突解决等真实场景中测试模型。对25个LLM的分析表明,较小模型(<250亿参数)的方向对齐性明显较低,常接近随机水平;而较大前沿模型(>1200亿参数)在人类共识一致时达到近乎完美的对齐,但在共识较低时稳定在80%中低段。模型倾向于鼓励情感开放(而人类建议保持沉稳),更注重和谐而非果断,并表现出更高的冲动性。研究还揭示,当人工标注者意见分歧时,模型系统性地过于自信,未能代表意见范围。这凸显了为恰当应对社会动态而需要更好的行为对齐。
来源: Google Research —
原文
