ModelosInvestigación 🇺🇸 11.08.2026 10:01

webAI presenta TwIL-LM: una familia de modelos de lógica formal para la autoformalización local

webAIwebAI
webAI ha lanzado TwIL-LM, una familia de dos modelos de lógica formal con 1.7 mil millones y 3 mil millones de parámetros, diseñados para ejecutarse de forma local. Los modelos se especializan en la autoformalización, traduciendo inglés a lógica de primer orden. Se publican bajo una licencia no comercial.
webAI ha lanzado TwIL-LM, una familia de dos modelos de razonamiento lógico formal con 1.7B y 3B de parámetros. El miembro de 3B, TwIL-LM3, es un fine-tuning fusionado de SmolLM3-3B; el miembro de 1.7B es un adaptador PEFT LoRA para SmolLM2-1.7B-Instruct. Ambos se centran en la autoformalización: traducir el inglés a lógica de primer orden y comprobar si una conclusión se deduce de sus premisas. Ambos se ejecutan localmente, con una versión cuantizada de 1.06 GB para el de 1.7B y un GGUF Q4_K_M de 1.78 GiB para el de 3B. El anuncio de webAI presenta el lanzamiento destacando que supera a gpt-oss-120b en cuatro de cinco áreas de razonamiento formal. El despliegue es parcial, ya que ambos checkpoints se publican bajo la Licencia No Comercial de webAI versión 1.0; el despliegue que genere ingresos requiere un acuerdo aparte. Los modelos se dirigen a diversas industrias, incluyendo cumplimiento y RegTech, servicios financieros, salud y farmacéutica, operaciones legales y de contratos, e investigación en métodos formales. Las aplicaciones incluyen traducción a lógica de primer orden (FOL, por sus siglas en inglés), clasificación de implicación, lenguaje natural a consulta estructurada, redacción y crítica de formalización en Lean, y una capa verificadora. TwIL-LM3 se construyó en cuatro etapas: fine-tuning supervisado con LoRA, fusión de checkpoints, interpolación WiSE-FT de vuelta a la base preentrenada con λ = 0.25, y MGPO, una etapa de GRPO ponderada por entropía ejecutada contra un verificador programático. El checkpoint publicado es el paso 2071. TwIL-LM3 obtiene 96.4 en inducción de reglas, 87.6 en análisis semántico, 64.6 en formalización en Lean, 52.0 en respuesta con formato exacto y 68.7 en etiquetado de implicación. En la Pista A, obtiene 0.4488 en el promedio de seis vías y 0.4218 en la puerta macro, liderando todas las variantes hasta LFM2.5-8B-A1B, pero no las dos variantes más grandes (Qwen3-8B y gpt-oss-120b). La eficiencia es una ventaja clave: TwIL-LM3 produce las generaciones más cortas (482 tokens) y la mayor cantidad de respuestas por segundo (32.9 frente a 4.2 para el de 120B). TwIL-LM3 mejora dentro del dominio en +26% relativo, a la vez que gana +0.022 en el promedio de núcleo fuera del dominio, siendo la única variante que mejora en ambas pistas. El modelo de 1.7B ofrece un equilibrio diferente con resultados mixtos fuera de la distribución. Conclusiones clave: TwIL-LM3 y TwIL-LM son para lógica formal bajo licencia no comercial; TwIL-LM3 está por detrás de gpt-oss-120b en el promedio de seis vías; su verdadera ventaja es la eficiencia; WiSE-FT con λ=0.25 es la razón por la que las ganancias dentro del dominio no colapsan el rendimiento fuera del dominio.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas