Ce qui manque aux chatbots LLM : un sens de l'objectif
OpenAI
Meta
Les chatbots modernes basés sur des modèles de langage excellent pour les requêtes ponctuelles, mais perdent le fil dans les dialogues multi-tours. Les recherches montrent que les modèles s'écartent rapidement de la consigne système après seulement quelques échanges. L'auteur propose une approche de « dialogue axé sur l'objectif » qui tient compte des objectifs à long terme et de l'interaction itérative.
Les chatbots LLM ne cessent de s'améliorer, mais leurs progrès sont mesurés par des benchmarks comme MMLU, HumanEval et MATH, qui testent les réponses en un seul tour. Cependant, des tâches du monde réel telles que la planification de voyages ou l'automatisation de problèmes GitHub nécessitent un dialogue multi-tours avec un raffinement des exigences. Des chercheurs ont montré que même des modèles avancés comme LLaMA2-chat-70B et GPT-3.5-turbo-16k perdent leur adhérence à la consigne système après environ 1,6 mille tokens (soit environ 16 tours). Ceci est confirmé par une expérience où deux agents LLM communiquaient entre eux, puis on vérifiait à quel point chacun suivait ses instructions. Le problème est que l'entraînement via l'apprentissage par renforcement à partir de retours humains (RLHF) ne prend pas en compte la planification multi-étapes – il optimise les réponses en un seul tour plutôt que les objectifs à long terme. L'auteur propose une approche de « dialogue orienté vers un but », où le chatbot agit comme un assistant qui clarifie progressivement les intentions de l'utilisateur. Des exemples de tels systèmes incluent le « dialogue orienté solution » et la plateforme Sotopia, qui modélisent la prise de décision collaborative. Pour créer de véritables assistants, nous devons non seulement générer du texte, mais concevoir des dialogues comme des jeux orientés vers un but, où chaque énoncé modifie le modèle du monde de l'interlocuteur.
Source: The Gradient —
original
