Google évalue l'alignement des tendances comportementales dans les grands modèles de langage
Google/DeepMind
Google Research présente un cadre qui transforme les questionnaires psychologiques en tests de jugement situationnel (SJT) pour évaluer l'alignement comportemental des grands modèles de langage. En testant 25 modèles, il apparaît que les modèles plus petits s'écartent souvent du consensus humain, tandis que les modèles plus grands montrent un alignement amélioré mais imparfait. L'étude révèle également que les modèles sont trop confiants lorsque les opinions humaines divergent.
Google Research présente un cadre pour évaluer les dispositions comportementales des grands modèles de langage (LLM) en adaptant des questionnaires psychologiques établis en tests de jugement situationnel. Ce cadre teste les modèles dans des scénarios réalistes tels que le sang-froid professionnel et la résolution de conflits. L'analyse de 25 LLM montre que les modèles plus petits (moins de 25 milliards de paramètres) ont une alignement directionnel nettement inférieur, souvent proche du hasard, tandis que les modèles de pointe plus grands (plus de 120 milliards de paramètres) atteignent un alignement quasi parfait sous consensus humain unanime, mais plafonnent entre 80 et 85 % lorsque le consensus est plus faible. Les modèles tendent à encourager l'ouverture émotionnelle là où les humains recommandent le sang-froid, à privilégier l'harmonie plutôt que l'affirmation de soi et à faire preuve d'une impulsivité plus élevée. L'étude révèle également que les modèles sont systématiquement trop confiants lorsque les annotateurs humains sont en désaccord, ne parvenant pas à représenter l'éventail des opinions. Cela souligne la nécessité d'un meilleur alignement comportemental pour naviguer de manière appropriée dans les dynamiques sociales.
Source: Google Research —
original
