OnderzoekAgenten 🇺🇸 28.07.2026 00:04

Wat LLM-chatbots missen: een gevoel van doelgerichtheid

OpenAIOpenAI MetaMeta
Moderne LLM-chatbots blinken uit in eenmalige vragen, maar verliezen focus in meerstapsgesprekken. Onderzoek toont aan dat modellen snel afdwalen van de systeemprompt na slechts een paar gespreksrondes. De auteur stelt een 'doelgerichte dialoog'-aanpak voor die rekening houdt met langetermijndoelen en iteratieve interactie.
LLM-chatbots verbeteren voortdurend, maar hun vooruitgang wordt gemeten aan de hand van benchmarks zoals MMLU, HumanEval en MATH, die eenmalige reacties testen. In de praktijk vereisen taken zoals reisplanning of het automatiseren van GitHub-problemen echter meerarmige dialogen met verfijning van de vereisten. Onderzoekers hebben aangetoond dat zelfs geavanceerde modellen zoals LLaMA2-chat-70B en GPT-3.5-turbo-16k na ongeveer 1,6 duizend tokens (ongeveer 16 beurten) de systeemprompt niet meer naleven. Dit wordt bevestigd door een experiment waarbij twee LLM-agenten met elkaar communiceerden en vervolgens werd gecontroleerd hoe goed elk zijn instructie volgde. Het probleem is dat training via Reinforcement Learning from Human Feedback (RLHF) geen rekening houdt met meerstapplanning: het optimaliseert eenmalige reacties in plaats van langetermijndoelen. De auteur stelt een 'doelgerichte dialoog'-benadering voor, waarbij de chatbot fungeert als een assistent die geleidelijk de intenties van de gebruiker verduidelijkt. Voorbeelden van dergelijke systemen zijn 'oplossingsgerichte dialoog' en het Sotopia-platform, die gezamenlijke besluitvorming modelleren. Om echte assistenten te creëren, moeten we niet alleen tekst genereren, maar dialogen ontwerpen als doelgerichte spellen, waarbij elke uiting het wereldmodel van de gesprekspartner verandert.
Bron: The Gradient — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws