сосредоточен на разработке составного многозадачного вознаграждения, которое Group Relative Policy Optimization (GRPO) может использовать для обучения, включая рабочий пример обучения Amazon Nova Lite 2.0 спрашивать перед написанием кода в многозадачной задаче совместного программирования. Пример использует четырехкомпонентное вознаграждение: правильность, asked_before_coding, guessed_immediately и loop_penalty. Также рассматривается безопасное выполнение сгенерированного моделью кода, с мерами предосторожности, такими как отсутствие раскрытия учетных данных или сети, применение ограничений ресурсов и проверка количества тестов. Раздел о подводных камнях обсуждает взлом вознаграждения, нестабильность обучения и коллапс вознаграждения, подчеркивая, что сигнал вознаграждения влияет на обучение только через вариацию внутри группы, поэтому термин, который принимает одно и то же значение для каждого завершения, не вносит вклад в градиент. Подчеркивается важность открытия желаемых поведений и наказания за режимы сбоя, а также необходимость инструментирования каждого компонента, чтобы доверять тому, что обучение изучает.