Оценка согласованности поведенческих склонностей в больших языковых моделях
Google/DeepMind
Google Research представила новый фреймворк для оценки поведенческих склонностей LLM, основанный на психологических опросниках и ситуационных тестах. Анализ 25 моделей показал, что маленькие модели демонстрируют низкое согласование с человеческим консенсусом, а большие модели переоценивают свою уверенность при слабом согласии людей, что указывает на необходимость улучшения поведенческого выравнивания.
Исследователи Google представили систематический фреймворк оценки поведенческих склонностей больших языковых моделей (LLM), преобразующий стандартные психологические опросники в крупномасштабные ситуационные тесты (SJT). В рамках работы были использованы валидированные инструменты, такие как IRI (эмпатия) и ERQ (эмоциональная регуляция). Модели тестировались на реалистичных сценариях, включающих
Показать ещё ↓
- Сокращения
- LLM = Large Language Model — большая языковая модель
- SJT = Situational Judgment Test — ситуационный тест суждений
- IRI = Interpersonal Reactivity Index — индекс межличностной реактивности
- ERQ = Emotion Regulation Questionnaire — опросник регуляции эмоций
Источник: Google Research —
оригинал
