webAI présente TwIL-LM : une famille de modèles de logique formelle pour l'autoformalisation locale
webAI
webAI a publié TwIL-LM, une famille de deux modèles de logique formelle de 1,7 milliard et 3 milliards de paramètres, conçus pour fonctionner en local. Ces modèles sont spécialisés dans l'autoformalisation, c'est-à-dire la traduction de l'anglais en logique du premier ordre. Ils sont publiés sous une licence non commerciale.
webAI a publié TwIL-LM, une famille de deux modèles de raisonnement en logique formelle de 1,7B et 3B de paramètres. Le membre de 3B, TwIL-LM3, est un affinage fusionné de SmolLM3-3B ; le membre de 1,7B est un adaptateur LoRA PEFT pour SmolLM2-1,7B-Instruct. Les deux visent l'auto-formalisation : traduire l'anglais en logique du premier ordre et vérifier si une conclusion découle de ses prémisses. Les deux fonctionnent localement, avec une version quantisée de 1,06 Go pour le 1,7B et un GGUF Q4_K_M de 1,78 Gio pour le 3B. L'annonce de webAI met l'accent sur le fait que le modèle bat gpt-oss-120b sur quatre des cinq pistes de raisonnement formel. Le déploiement est partiel, car les deux points de contrôle sont publiés sous la licence non commerciale de webAI version 1.0 ; le déploiement générant des revenus nécessite un accord séparé. Les modèles ciblent divers secteurs, notamment la conformité et la RegTech, les services financiers, la santé et la pharma, le juridique et la gestion des contrats, et la recherche en méthodes formelles. Les applications incluent la traduction en logique du premier ordre (FOL), la classification de conséquence logique, la conversion du langage naturel en requêtes structurées, la rédaction et la critique de formalisation Lean, et une couche de vérification. TwIL-LM3 a été construit en quatre étapes : un apprentissage supervisé LoRA, une fusion de points de contrôle, une interpolation WiSE-FT en retour vers la base pré-entraînée avec lambda = 0,25, et MGPO, une étape GRPO pondérée par l'entropie exécutée contre un vérificateur programmatique. Le point de contrôle publié est l'étape 2071. TwIL-LM3 obtient 96,4 sur l'induction de règles, 87,6 sur l'analyse sémantique, 64,6 sur la formalisation Lean, 52,0 sur la réponse au format exact, et 68,7 sur l'étiquetage de conséquence. Sur la piste A, il obtient 0,4488 sur la moyenne des six pistes et 0,4218 sur la porte macro, en tête de tous les bras jusqu'à LFM2.5-8B-A1B mais pas des deux plus grands bras (Qwen3-8B et gpt-oss-120b). L'efficacité est un avantage clé : TwIL-LM3 produit les générations les plus courtes (482 jetons) et le plus de réponses par seconde (32,9 contre 4,2 pour le 120B). TwIL-LM3 améliore le domaine interne de +26% en relatif tout en gagnant +0,022 sur la moyenne des cœurs hors distribution, étant le seul bras à gagner sur les deux pistes. Le modèle de 1,7B offre un compromis différent avec des résultats hors distribution mitigés. Points clés : TwIL-LM3 et TwIL-LM sont destinés à la logique formelle sous licence non commerciale ; TwIL-LM3 est en retrait par rapport à gpt-oss-120b sur la moyenne des six pistes ; son véritable avantage est l'efficacité ; WiSE-FT à lambda = 0,25 est la raison pour laquelle les gains en domaine interne ne font pas s'effondrer les performances hors distribution.
Source: MarkTechPost —
original
