из США со 2-го по 7-й класс. Эти транскрипты были размечены опытными учителями математики, которые выделили ключевые моменты, когда репетитору приходилось выбирать между поддержкой и требованием более строгого подхода. В ходе тестов семи большим языковым моделям давали транскрипты вплоть до точки принятия решения и просили продолжить в роли репетитора с воображаемым учеником. Результаты показали, что при простом запросе модели, как правило, слишком активно помогали, но когда компромисс был явно описан в запросе, все модели улучшили свои показатели, хотя и не достигли уровня согласованности, свойственного репетиторам-людям. Исследователи публикуют набор данных, код и записи для воспроизводимости, подчеркивая, что автоматизированная оценка не может заменить исследования реальных результатов обучения. Проект получил поддержку от Фонда Билла и Мелинды Гейтс и Learning Commons.