Google оценивает согласованность поведенческих тенденций в больших языковых моделях

Google/DeepMindGoogle/DeepMind
Google Research представляет фреймворк, преобразующий психологические опросники в ситуационные тесты (SJT) для оценки поведенческого выравнивания больших языковых моделей. Тестирование 25 моделей показало, что меньшие модели часто отклоняются от человеческого консенсуса, в то время как более крупные демонстрируют улучшенное, но несовершенное выравнивание. Исследование также выявило, что модели чрезмерно уверены в себе, когда мнения людей расходятся.
Google Research представляет фреймворк для оценки поведенческих качеств больших языковых моделей (LLM) путем адаптации устоявшихся психологических опросников в тесты ситуационного суждения. Фреймворк тестирует модели в реалистичных сценариях, таких как профессиональная выдержка и разрешение конфликтов. Анализ 25 LLM показывает, что меньшие модели (с числом параметров менее 25 миллиардов) имеют
Показать ещё ↓
Источник: Google Research — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости