webAI Memperkenalkan TwIL-LM: Keluarga Model Logika Formal untuk Autoformalization Lokal
webAI
webAI telah merilis TwIL-LM, sebuah keluarga dari dua model logika formal dengan parameter 1,7 miliar dan 3 miliar, yang dirancang untuk berjalan secara lokal. Model-model ini mengkhususkan diri dalam autoformalization, yaitu menerjemahkan bahasa Inggris ke dalam logika orde pertama. Mereka dirilis di bawah lisensi non-komersial.
webAI merilis TwIL-LM, keluarga model penalar logika formal dengan dua varian, yaitu 1,7 miliar dan 3 miliar parameter. Anggota 3 miliar, TwIL-LM3, adalah fine-tune gabungan dari SmolLM3-3B; anggota 1,7 miliar adalah adapter PEFT LoRA untuk SmolLM2-1.7B-Instruct. Keduanya menargetkan autoformalization: menerjemahkan bahasa Inggris menjadi logika urutan pertama dan memeriksa apakah kesimpulan mengikuti premis-premisnya. Keduanya berjalan secara lokal, dengan build kuantisasi 1,06 GB untuk 1,7 miliar dan GGUF Q4_K_M sebesar 1,78 GiB untuk 3 miliar. Pengumuman webAI merilis ini dengan menekankan keunggulan atas gpt-oss-120b dalam empat dari lima jalur penalaran formal. Peluncurannya bersifat parsial, karena kedua checkpoint dirilis di bawah Lisensi Non-Komersial webAI versi 1.0; penggunaan untuk menghasilkan pendapatan memerlukan perjanjian terpisah. Model-model ini menargetkan berbagai industri termasuk kepatuhan dan RegTech, layanan keuangan, perawatan kesehatan dan farmasi, operasi hukum dan kontrak, serta penelitian metode formal. Aplikasinya mencakup penerjemahan logika urutan pertama (FOL), klasifikasi entailment, bahasa alami menjadi kueri terstruktur, penyusunan dan kritik formalisasi Lean, serta lapisan verifier. TwIL-LM3 dibangun melalui empat tahap: supervised fine-tuning LoRA, fusi checkpoint, interpolasi WiSE-FT kembali ke basis pra-latihan dengan λ = 0,25, dan MGPO, tahap GRPO berbobot entropi yang dijalankan terhadap verifier berbasis program. Checkpoint yang diterbitkan adalah langkah 2071. TwIL-LM3 mencetak skor 96,4 pada induksi aturan, 87,6 pada penguraian semantik, 64,6 pada formalisasi Lean, 52,0 pada penjawaban format tepat, dan 68,7 pada pelabelan entailment. Pada Trek A, skornya 0,4488 pada rata-rata enam jalur dan 0,4218 pada gerbang makro, memimpin semua lengan hingga LFM2.5-8B-A1B tetapi tidak dua lengan terbesar (Qwen3-8B dan gpt-oss-120b). Efisiensi adalah keunggulan utama: TwIL-LM3 menghasilkan generasi terpendek (482 token) dan jawaban per detik terbanyak (32,9 berbanding 4,2 untuk 120B). TwIL-LM3 meningkatkan dalam-domain sebesar +26% relatif sekaligus memperoleh +0,022 pada rata-rata inti yang dipertahankan, menjadi satu-satunya lengan yang meningkat pada kedua trek. Model 1,7 miliar menawarkan trade-off berbeda dengan hasil di luar distribusi yang beragam. Poin utama: TwIL-LM3 dan TwIL-LM ditujukan untuk logika formal di bawah lisensi non-komersial; TwIL-LM3 tertinggal dari gpt-oss-120b pada rata-rata enam jalur; keunggulan sebenarnya adalah efisiensi; WiSE-FT dengan λ=0,25 adalah alasan mengapa peningkatan dalam-domain tidak mengurangi kinerja yang dipertahankan.
Sumber: MarkTechPost —
asli
