Recherche 🇺🇸 27.07.2026 16:04

Évaluation de la cohérence des tendances comportementales dans les grands modèles de langage

Google/DeepMindGoogle/DeepMind
Google Research a introduit un nouveau cadre pour évaluer les tendances comportementales des grands modèles de langage (LLMs), basé sur des questionnaires psychologiques et des tests situationnels. L'analyse de 25 modèles a montré que les petits modèles présentent un faible alignement avec le consensus humain, tandis que les grands modèles surestiment leur confiance lorsque l'accord humain est faible, ce qui indique la nécessité d'améliorer l'alignement comportemental.
Des chercheurs de Google ont présenté un cadre d'évaluation systématique des biais comportementaux des grands modèles de langage (LLM), convertissant les questionnaires psychologiques standardisés en tests situationnels à grande échelle (SJT). Ce travail a utilisé des outils validés tels que l'IRI (empathie) et l'ERQ (régulation émotionnelle). Les modèles ont été testés sur des scénarios réalistes incluant des comportements professionnels, la résolution de conflits et des tâches quotidiennes. L'analyse de 25 LLM a révélé deux types de divergences : un écart par rapport au consensus humain malgré un accord élevé entre annotateurs, et une prise en compte insuffisante de la diversité des opinions en cas de faible consensus. Les petits modèles (moins de 25 milliards de paramètres) ont montré un alignement nettement inférieur, ne distinguant souvent pas l'expression ou la suppression appropriée des traits. Les grands modèles (plus de 120 milliards de paramètres) atteignaient un alignement quasi parfait en cas de consensus unanime, mais leurs performances atteignaient un plateau à 80 % lorsque le consensus descendait en dessous de 90 %. L'analyse qualitative a révélé que les modèles ont tendance à encourager l'ouverture émotionnelle dans des situations professionnelles où les humains recommandent la retenue, et à privilégier l'harmonie plutôt que l'affirmation de soi dans les disputes sociales. Une surestimation systématique de la confiance a également été constatée : les 25 modèles n'ont pas réduit leur confiance en cas de faible accord humain, violant ainsi le principe de pluralisme des distributions. Le cadre a également mis en évidence des écarts entre les auto-évaluations des modèles et leur comportement réel : par exemple, les modèles déclarent souvent une faible impulsivité, mais sont en réalité enclins à des actions impulsives.
Source: Google Research — original
Nos articles précédents sur ce sujet ↓
Infos fraîches