(синтаксическая проверка), бэктестинг (выполнение в рантайме), сделка (выполнение хотя бы одной сделки) и судья (семантическое соответствие с помощью LLM-судьи). Поддерживаются два режима: однопроходный (одноразовая генерация) и агентный многопроходный (до 10 итеративных уточнений с обратной связью). Результаты показывают, что, хотя почти все сильные модели достигают идеальной компиляции в однопроходном режиме, итоговый показатель прохождения судьи сильно варьируется, причем GPT-5.5 лидирует с результатом 82,5%. В многопроходном режиме производительность значительно улучшается: GPT-5.5 достигает 98,8% прохождения судьи. Бенчмарк подчеркивает, что синтаксическая корректность является недостаточной для генерации кода в предметной области и что модели должны понимать торговую область, семантику API и операционализировать нечеткие описания.