обучение, контролируемую тонкую настройку и обучение с подкреплением методом CISPO в двух средах RL: многошаговой среде для доказательства теорем с обратной связью от компилятора Lean и среде агента-разработчика, работающего в файловой системе. Leanstral 1.5 демонстрирует сильное масштабирование на этапе тестирования: производительность на PutnamBench выросла с 44 решённых задач при 50 тысячах токенов до 587 при 4 миллионах токенов. Модель также превосходна в верификации кода, доказывая гарантии временной сложности для AVL-деревьев и выявляя 5 ранее неизвестных ошибок в 57 протестированных репозиториях. Модель полностью открыта через Hugging Face и предоставляется через бесплатный API-эндпоинт.