задач, их решением и проверкой, создавая высококачественные синтетические данные для самообучения без участия человека в каждой конкретной задаче. Модель с 35 миллиардами параметров и примерно 3 миллиардами активных параметров при инференсе поддерживает длинный контекст в 262 тысячи токенов и полностью обучается на синтетических данных, сгенерированных ИИ, сфокусированных на задачах передовой науки. Она заняла десять первых мест среди моделей с 35 миллиардами параметров в бенчмарках, включая длительные поисковые задачи, программирование, научные исследования и исследования в области ИИ, а также превзошла модель DeepSeek V4 Pro Preview с триллионом параметров в сложных научных задачах, таких как FrontierScience Research и PaperBench. Примеры её возможностей включают точное определение места вставки транспозона с использованием данных о стыках и воспроизведение статьи в исполняемый код с самокоррекцией в ходе смоук-тестов. Команда подчёркивает, что система производства данных сама может быть оптимизирована, требуя задач, которые одновременно являются передовыми и проверяемыми, и они реализуют двухконтурный конвейер: внутренний цикл с агентами-генератором и критиком, которые создают и проверяют данные, и внешний цикл, управляемый реальными результатами обучения для калибровки системы. Этот контур RSI на уровне данных предотвращает коллапс синтетических данных, при этом люди по-прежнему определяют цели, бюджеты, риски и критерии приёмки. Модель и код открыты для использования на Hugging Face и GitHub.