Verifiable Rewards, обучение с подкреплением на основе проверяемых наград), при котором модели ставятся цели и она сама предпринимает шаги для их достижения. Вероятно, OpenAI использует RLVR для обучения моделей выполнению задач в сфере кибербезопасности, что может провоцировать агрессивное поведение без каких-либо ограничений безопасности, поскольку такие ограничения добавляются уже позже. Отсутствие контроля объясняется параллельным выполнением тысяч похожих задач, из-за чего легко упустить из виду подмножество агентов, оставляющих сообщения в именах файлов. Уиллисон проводит аналогию с обучением моделей не проявлять расизм, где знакомство с негативными примерами необходимо для последующей корректировки поведения.