webAI apresenta TwIL-LM: uma família de modelos de lógica formal para autoformalização local
webAI
A webAI lançou o TwIL-LM, uma família de dois modelos de lógica formal com 1,7 bilhão e 3 bilhões de parâmetros, projetados para execução local. Os modelos são especializados em autoformalização, traduzindo inglês para lógica de primeira ordem. Eles são disponibilizados sob uma licença não comercial.
A webAI lançou o TwIL-LM, uma família de dois modelos de raciocínio lógico formal com 1,7B e 3B de parâmetros. O membro de 3B, TwIL-LM3, é um fine-tune mesclado do SmolLM3-3B; o membro de 1,7B é um adaptador LoRA PEFT para o SmolLM2-1,7B-Instruct. Ambos visam a autoformalização: traduzir inglês para lógica de primeira ordem e verificar se uma conclusão decorre de suas premissas. Ambos rodam localmente, com uma compilação quantizada de 1,06 GB para o 1,7B e um GGUF Q4_K_M de 1,78 GiB para o 3B. O anúncio da webAI enquadra o lançamento em torno de superar o gpt-oss-120b em quatro das cinco pistas de raciocínio formal. A implantação é parcial, pois ambos os checkpoints são distribuídos sob a Licença Não Comercial webAI versão 1.0; a implantação geradora de receita requer um acordo separado. Os modelos visam várias indústrias, incluindo conformidade e RegTech, serviços financeiros, saúde e farmacêutica, operações jurídicas e de contratos, e pesquisa em métodos formais. As aplicações incluem tradução para lógica de primeira ordem (FOL), classificação de implicação, consulta estruturada a partir de linguagem natural, elaboração e crítica de formalização em Lean, e uma camada de verificação. O TwIL-LM3 foi construído em quatro etapas: fine-tuning supervisionado com LoRA, fusão de checkpoints, interpolação WiSE-FT de volta à base pré-treinada com λ = 0,25, e MGPO, um estágio de GRPO com ponderação por entropia executado contra um verificador programático. O checkpoint publicado é o passo 2071. O TwIL-LM3 pontua 96,4 em indução de regras, 87,6 em parsing semântico, 64,6 em formalização em Lean, 52,0 em resposta com formato exato e 68,7 em rotulagem de implicação. Na Trilha A, ele pontua 0,4488 na média de seis pistas e 0,4218 no portão macro, liderando todos os braços até o LFM2.5-8B-A1B, mas não os dois maiores braços (Qwen3-8B e gpt-oss-120b). A eficiência é uma vantagem chave: o TwIL-LM3 produz as gerações mais curtas (482 tokens) e mais respostas por segundo (32,9 vs 4,2 para o 120B). O TwIL-LM3 melhora no domínio em +26% relativo, enquanto também ganha +0,022 na média de núcleo fora do conjunto, sendo o único braço a ganhar em ambas as trilhas. O modelo de 1,7B oferece uma troca diferente com resultados fora da distribuição mistos. Principais conclusões: TwIL-LM3 e TwIL-LM são para lógica formal sob licença não comercial; TwIL-LM3 fica atrás do gpt-oss-120b na média de seis pistas; sua vantagem real é a eficiência; WiSE-FT com λ = 0,25 é o motivo pelo qual os ganhos no domínio não colapsam o desempenho fora do conjunto.
Fonte: MarkTechPost —
original
