целые программы с нуля, имея в распоряжении только исполняемый "черный ящик", документацию и видимые тесты; решения должны проходить все скрытые тесты. Бенчмарк включает 15 реальных программ, таких как sed и Ruff, каждая из которых реализована на двух языках, с бюджетом в 10 миллиардов токенов и 7 днями на попытку. Анализ тепловой карты показывает, что Sol часто решает задачи частично (успех в 50%, 33%, 17% случаев), в то время как Fable почти всегда завершает их полностью (100%, 83%). Еще одна подсказка: производительность Fable лишь незначительно падает на Ada (61% против 64% на Go), в то время как модели OpenAI значительно теряют на Ada — Sol падает с 24% до 19%, GPT-5.4 с 21% до 12%, а GPT-5.5 с 17% до 5%. Поскольку в обучающих данных почти нет реализаций этих программ на Ada, устойчивость Fable на Ada указывает на подлинное мастерство, а не на запоминание. Однако собственная проверка на загрязнение данных от Epoch выявила признаки запоминания в 17 из 25 программ, а точная спецификация бенчмарка отличается от реальной разработки.