GPT-3.5-turbo-16k, перестают следовать системному промпту после примерно 1,6 тысячи токенов (около 16 раундов). Это подтверждается экспериментом, в котором два LLM-агента общались друг с другом, а затем проверялось, насколько хорошо каждый из них следовал своей инструкции. Проблема в том, что обучение через обучение с подкреплением на основе обратной связи от человека (Reinforcement Learning from Human Feedback, RLHF) не учитывает многошаговое планирование — оно оптимизирует одношаговые ответы, а не долгосрочные цели. Автор предлагает подход «целенаправленного диалога», в котором чатбот выступает в роли ассистента, постепенно уточняющего намерения пользователя. Примеры таких систем включают «ориентированный на решение диалог» и платформу Sotopia, которые моделируют совместное принятие решений. Чтобы создать настоящих ассистентов, нужно не просто генерировать текст, а проектировать диалоги как целеустремленные игры, где каждое высказывание изменяет мировую модель собеседника.