评估大语言模型行为倾向的一致性
Google/DeepMind
谷歌研究团队引入了一种基于心理问卷和情境测试的新框架,用于评估大语言模型的行为倾向。对25个模型的分析表明,小型模型与人类共识的一致性较低,而大型模型在人类一致性较弱时高估自身可信度,这表明需要改进行为对齐。
Исследователи Google представили систематическую структуру для оценки поведенческих склонностей больших языковых моделей (LLM), преобразовав стандартные психологические опросники в крупномасштабные ситуационные тесты (SJT). В работе использовались валидированные инструменты, такие как IRI (эмпатия) и ERQ (эмоциональная регуляция). Модели тестировались на реалистичных сценариях, включающих профессиональное поведение, разрешение конфликтов и повседневные задачи. Анализ 25 LLM выявил два типа расхождений: отклонение от человеческого консенсуса при высоком согласии аннотаторов и недостаточное отражение разнообразия мнений при низком консенсусе. Маленькие модели (менее 25 млрд параметров) показали значительно худшее согласование, часто не различая уместное выражение или подавление черт. Большие модели (более 120 млрд параметров) при единогласном консенсусе достигали почти идеального согласования, но при консенсусе ниже 90% их показатели выходили на плато на уровне 80%. Качественный анализ показал, что модели склонны поощрять эмоциональную открытость в профессиональных ситуациях, где люди рекомендуют сдержанность, а в социальных спорах отдают приоритет гармонии над отстаиванием позиции. Также обнаружена систематическая переоценка уверенности: все 25 моделей не снижали уверенность при низком согласии людей, что нарушает принцип плюрализма распределений. Структура также выявила расхождения между самоотчётами моделей и их реальным поведением: например, модели часто сообщают о низкой импульсивности, но на деле склонны к импульсивным действиям.
来源: Google Research —
原文
