ModelosCódigo Abierto 🇺🇸 27.07.2026 05:04

Mistral AI lanza Leanstral 1.5: modelo gratuito para verificación formal con resultados récord

MistralMistral OpenAIOpenAI
Mistral AI ha presentado Leanstral 1.5, un modelo de código abierto (licencia Apache-2.0) con 6 mil millones de parámetros activos, que alcanza saturación en miniF2F, resuelve 587 de 672 problemas de PutnamBench y establece nuevos récords en FATE-H (87%) y FATE-X (34%). El modelo se entrena en tres etapas, incluido aprendizaje por refuerzo con el método CISPO, y puede encontrar errores previamente desconocidos en código real (5 errores en 57 repositorios). Los pesos y la API están disponibles de forma gratuita.
Mistral AI ha anunciado el lanzamiento de Leanstral 1.5, una versión actualizada de su modelo para la demostración formal de teoremas en lenguaje Lean 4. El modelo cuenta con 119 mil millones de parámetros en total, pero solo 6 mil millones activos, y se distribuye bajo la licencia Apache 2.0. Leanstral 1.5 alcanza el llenado completo del punto de referencia miniF2F (100% en los conjuntos de validación y prueba), resuelve 587 de las 672 tareas de PutnamBench (superando a Seed-Prover 1.5 en 7 tareas con un costo significativamente menor: aproximadamente 4 dólares por tarea frente a más de 300 dólares), y establece un nuevo récord en los puntos de referencia FATE-H (87 tareas resueltas) y FATE-X (34 tareas resueltas). El entrenamiento se llevó a cabo en tres etapas: entrenamiento intermedio, ajuste fino supervisado y aprendizaje por refuerzo con el método CISPO en dos entornos: multijugador (el modelo interactúa con el compilador de Lean) y agente (el modelo trabaja como desarrollador en el sistema de archivos). Leanstral 1.5 también muestra una excelente escalabilidad en el tiempo de prueba: cuanto más tokens se asignan por intento, más tareas se resuelven. En el punto de referencia FLTEval, basado en solicitudes de extracción reales del repositorio del Gran Teorema de Fermat, el modelo mejoró pass@1 del 21.9% al 28.9% y pass@8 del 31.9% al 43.2%. En casos de verificación de código, el modelo demostró la complejidad temporal de los árboles AVL (O(log n)), utilizando 2.7 millones de tokens y 22 compactaciones, y en el pipeline automático encontró 47 propiedades violadas en 57 repositorios, de las cuales 11 apuntaban a errores reales, siendo 5 de ellas no reportadas previamente en GitHub. Uno de los errores se detectó en la función de signo para decodificación zigzag de la biblioteca datrs/varinteger: desbordamiento en la suma al ingresar Std.U64.MAX. El modelo está disponible de forma gratuita a través de la API (punto final leanstral-1-5) y en Hugging Face, y se recomienda su uso a través de Mistral Vibe.
Fuente: Mistral AI — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas