Google、大規模言語モデルの行動傾向におけるアラインメントを評価
Google/DeepMind
Google Researchは、心理学的質問票を状況判断テスト(SJT)に変換し、LLMの行動アラインメントを評価するフレームワークを導入。25のモデルをテストした結果、小規模モデルは人間のコンセンサスから逸脱することが多く、大規模モデルは改善されたものの不完全なアラインメントを示すことが判明。また、人間の意見が分かれる場合、モデルは過信する傾向がある。
Google Researchは、確立された心理学的質問票を状況判断テストに適応させることで、大規模言語モデルにおける行動特性を評価するフレームワークを発表しました。このフレームワークは、プロフェッショナルな落ち着きや紛争解決などの現実的なシナリオでモデルをテストします。25のLLMの分析により、小規模モデル(250億パラメータ未満)は方向性の整合性が著しく低く、しばしば偶然レベルに近いのに対し、大規模フロンティアモデル(1200億超)は人間の全員一致の下では完全に近い整合性を達成するものの、コンセンサスが低い場合には低~中程度の80%台で頭打ちになることが示されました。モデルは、人間が落ち着きを推奨する場面で感情の開放性を奨励し、自己主張よりも調和を優先し、衝動性が高い傾向があります。また、この研究は、人間のアノテーターが意見を異にする場合、モデルが系統的に過信し、意見の幅を適切に表現できないことも明らかにしています。これは、社会的ダイナミクスを適切に操るために、より優れた行動の整合性が必要であることを浮き彫りにしています。
出典: Google Research —
原文
