модели с 9 миллиардами параметров на всех двенадцати мирах повысило её результат с 36,5% до 67,1%, приблизившись к производительности GPT-5.4. Ключевые выводы включают необходимость высокой точности симуляции, эффективность отработки сложных элементов интерфейса (например, выбора даты) и преимущества совместного развития модели, мира и верификатора. Обучение с подкреплением на основе достоверных верификаторов в качестве вознаграждения превзошло имитационное обучение. Microsoft публикует четыре мира вместе с кодом, данными и средствами оценки для поддержки дальнейших исследований.