ModellenOnderzoek 🇺🇸 11.08.2026 10:01

webAI introduceert TwIL-LM: een familie van formeel-logische modellen voor lokale autoformalizering

webAIwebAI
webAI heeft TwIL-LM uitgebracht, een familie van twee formeel-logische modellen met respectievelijk 1,7 miljard en 3 miljard parameters, ontworpen om lokaal te draaien. De modellen specialiseren zich in autoformalizering, het vertalen van Engels naar eerste-ordelogica. Ze worden uitgebracht onder een niet-commerciële licentie.
webAI heeft TwIL-LM uitgebracht, een familie van twee modellen voor formeel-logisch redeneren met 1,7 miljard en 3 miljard parameters. Het 3 miljard model, TwIL-LM3, is een samengevoegde fine-tune van SmolLM3-3B; het 1,7 miljard model is een PEFT LoRA-adapter voor SmolLM2-1.7B-Instruct. Beide richten zich op autoformalizatie: het vertalen van het Engels naar predicatenlogica en het controleren of een conclusie volgt uit de premissen. Beide draaien lokaal, met een gekwantiseerde build van 1,06 GB voor de 1,7B en een Q4_K_M GGUF van 1,78 GiB voor de 3B. De aankondiging van webAI benadrukt dat de release beter presteert dan gpt-oss-120b op vier van de vijf formele redeneertracks. De uitrol is gedeeltelijk, aangezien beide checkpoints worden geleverd onder de webAI Non-Commercial License versie 1.0; inzet die inkomsten genereert vereist een afzonderlijke overeenkomst. De modellen richten zich op verschillende industrieën, waaronder compliance en RegTech, financiële dienstverlening, gezondheidszorg en farmacie, juridische en contractuele operaties, en onderzoek naar formele methoden. Toepassingen zijn onder meer vertaling naar predicatenlogica (FOL), classificatie van gevolgtrekkingen, natuurlijke taal naar gestructureerde query's, het opstellen en bekritiseren van Lean-formalisaties, en een verifieerlaag. TwIL-LM3 is opgebouwd in vier fasen: LoRA-supervised fine-tuning, checkpoint-fusie, WiSE-FT-interpolatie terug naar de vooraf getrainde basis met λ = 0,25, en MGPO, een entropie-gewogen GRPO-fase die wordt uitgevoerd tegen een programmatische verificateur. De gepubliceerde checkpoint is stap 2071. TwIL-LM3 scoort 96,4 op regelinductie, 87,6 op semantische parsing, 64,6 op Lean-formalisatie, 52,0 op exacte format-antwoorden en 68,7 op gevolgtrekkingslabeling. Op Track A scoort het 0,4488 op het zesbaans gemiddelde en 0,4218 op de macro-gate, en leidt het elke arm tot aan LFM2.5-8B-A1B, maar niet de twee grootste armen (Qwen3-8B en gpt-oss-120b). Efficiëntie is een belangrijk voordeel: TwIL-LM3 produceert de kortste generaties (482 tokens) en de meeste antwoorden per seconde (32,9 versus 4,2 voor de 120B). TwIL-LM3 verbetert in-domain relatief met +26%, terwijl het ook +0,022 wint op het gemiddelde van de vastgehouden kern, en is de enige arm die op beide tracks wint. Het 1,7 miljard model biedt een andere afweging met gemengde out-of-distribution resultaten. Belangrijkste punten: TwIL-LM3 en TwIL-LM zijn bedoeld voor formele logica onder een niet-commerciële licentie; TwIL-LM3 blijft achter bij gpt-oss-120b op het zesbaans gemiddelde; het echte voordeel is efficiëntie; WiSE-FT met λ=0,25 is de reden waarom in-domain winsten de prestaties op vastgehouden gegevens niet laten instorten.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws