задания, другим добавили внутреннюю награду за любопытство, которая связана со сложностью: когда робот сталкивается с новым и его внутренняя картина мира рушится, он получает бонус. В середине обучения любопытные роботы начинали вести себя как дети: переворачивали и толкали предметы без команды, просто чтобы посмотреть, что будет. Эта игра резко ускоряла освоение языка. Когда роботам показывали 48 разных языковых конструкций, любопытные справлялись с новыми задачами в 25 процентах случаев, а при 180 конструкциях точность вырастала до 85 процентов. Учёные также намеренно запутали роботов, награждая за выполнение одной задачи так, будто выполнена другая. Поначалу роботы следовали командам, затем начали ошибаться, а потом разобрались с исключением, показав U-образную кривую, аналогичную графику успеваемости у детей при освоении неправильных глаголов. Авторы подчёркивают, что ничего не программировали специально — роботы додумались до этого сами. Платформа прозрачна: скрытое состояние, в котором закодированы прогнозы, полностью доступно, что позволяет в реальном времени следить за построением плана действий. Руководитель лаборатории профессор Дзюн Тани отмечает, что роботы не думают как дети, но абстракция позволяет изучать роль любопытства в модели обучения языку.