ленивому вечернему подходу, который сработал. Он объясняет, что ключевым было не улучшение контроля над агентами, а то, кто оценивает результат. Он ссылается на прецеденты: QR-разложение sankalp достигает ускорения в 232 раза на пакетном QR, автоисследовательский скрипт Карпати из 630 строк запускал сотни экспериментов за ночь, а AlphaEvolve от DeepMind улучшила решения для 20% из 50 открытых математических задач и ускорила центры обработки данных, проектирование чипов и обучение ИИ в Google. Он делится двумя личными случаями: в первом он потратил две недели на ручную настройку фильтров для датасета, но оракул на основе Gemini с VLM (моделью видения) превзошёл это за пару запусков; во втором он добился ускорения обучения на 30%, но столкнулся с подводными камнями: забыл включить проверку паритета потерь (что привело к NaN-потерям), а недостаточно детальный оракул упускал артефакты, такие как оставшиеся буквы при удалении текста из изображений. Он подчёркивает, что создание хорошего оракула и цикла — это настоящая работа, и что модель внутри цикла имеет значение. Он заключает, что экспертиза смещается с «найти решение» на «построить систему, которая находит решения».