Lo que falta a los chatbots LLM: un sentido de propósito
OpenAI
Meta
Los chatbots LLM modernos destacan en consultas únicas, pero pierden el foco en diálogos de múltiples turnos. La investigación muestra que los modelos se desvían rápidamente del prompt del sistema después de solo unas pocas rondas de conversación. El autor propone un enfoque de "diálogo impulsado por propósito" que tenga en cuenta objetivos a largo plazo e interacción iterativa.
Los chatbots conversacionales mejoran constantemente, pero su progreso se mide con puntos de referencia como MMLU, HumanEval y MATH, que evalúan respuestas únicas. Sin embargo, tareas del mundo real, como la planificación de viajes o la automatización de incidencias en GitHub, requieren diálogos multi-turno con refinamiento de requisitos. Los investigadores han demostrado que incluso modelos avanzados como LLaMA2-chat-70B y GPT-3.5-turbo-16k pierden adherencia al prompt del sistema tras aproximadamente 1.6 mil tokens (unas 16 rondas). Esto se confirma con un experimento donde dos agentes conversacionales se comunicaban entre sí, y luego se verificaba cuán bien cada uno seguía su instrucción. El problema es que el entrenamiento mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF, por sus siglas en inglés) no contempla la planificación multi-paso: optimiza respuestas únicas en lugar de objetivos a largo plazo. El autor propone un enfoque de "diálogo dirigido a objetivos", donde el chatbot actúa como un asistente que clarifica gradualmente las intenciones del usuario. Ejemplos de estos sistemas incluyen el "diálogo orientado a soluciones" y la plataforma Sotopia, que modelan la toma de decisiones colaborativa. Para crear verdaderos asistentes, no basta con generar texto, sino que debemos diseñar diálogos como juegos dirigidos a objetivos, donde cada enunciado modifica el modelo del mundo del interlocutor.
Fuente: The Gradient —
original
