النماذجالأبحاث 🇺🇸 11.08.2026 10:01

webAI تطلق عائلة نماذج TwIL-LM للمنطق الرسمي للاستخدام المحلي

webAIwebAI
أصدرت webAI عائلة نماذج TwIL-LM، وهي مجموعة من نموذجين للمنطق الرسمي بمعاملات تبلغ 1.7 مليار و3 مليارات، مصممة للعمل محليًا. تتخصص النماذج في التحويل التلقائي إلى صياغة رسمية، حيث تترجم الإنجليزية إلى منطق من الدرجة الأولى. وقد أُصدرت هذه النماذج بموجب ترخيص غير تجاري.
أصدرت webAI عائلة نماذج TwIL-LM، وهي عائلة من نماذج الاستدلال المنطقي الرسمي بحجمين: 1.7 مليار و3 مليارات معلمة. العضو بحجم 3 مليارات، TwIL-LM3، هو نموذج معدل بدقة مدمج من SmolLM3-3B؛ بينما العضو بحجم 1.7 مليار هو محول LoRA (تكيف منخفض الرتبة) لنموذج SmolLM2-1.7B-Instruct. يستهدف كلا النموذجين الأتمتة الرسمية: ترجمة اللغة الإنجليزية إلى منطق الرتبة الأولى والتحقق مما إذا كانت النتيجة تتبع من المقدمات. يعمل كلاهما محليًا، مع نسخة كمية بحجم 1.06 جيجابايت للنموذج 1.7B ونسخة Q4_K_M GGUF بحجم 1.78 جيجابايت للنموذج 3B. يسلط إعلان webAI الضوء على تفوق النموذج على gpt-oss-120b في أربعة من خمسة مسارات استدلال رسمي. النشر جزئي، حيث يتم إصدار كلا النموذجين بموجب ترخيص webAI غير التجاري الإصدار 1.0؛ ويتطلب النشر المدر للدخل اتفاقية منفصلة. تستهدف النماذج العديد من الصناعات بما في ذلك الامتثال وتقنية التنظيم (RegTech)، والخدمات المالية، والرعاية الصحية والأدوية، والعمليات القانونية والتعاقدية، وأبحاث الطرق الرسمية. تشمل التطبيقات: ترجمة منطق الرتبة الأولى (FOL)، وتصنيف الاستلزام، وتحويل اللغة الطبيعية إلى استعلام منظم، وصياغة ومراجعة براهين Lean الرسمية، وطبقة تحقق. تم بناء TwIL-LM3 عبر أربع مراحل: الضبط الدقيق الخاضع للإشراف باستخدام LoRA، ودمج نقاط التفتيش، واستيفاء WiSE-FT نحو القاعدة المدربة مسبقًا عند λ = 0.25، ومرحلة MGPO، وهي مرحلة GRPO موزونة بالإنتروبيا تعمل مقابل مدقق برمجي. نقطة التفتيش المنشورة هي الخطوة 2071. يسجل TwIL-LM3 درجة 96.4 في الاستقراء القاعدي، و87.6 في التحليل الدلالي، و64.6 في إضفاء الطابع الرسمي على Lean، و52.0 في الإجابة بالتنسيق الدقيق، و68.7 في تصنيف الاستلزام. في المسار A، يسجل 0.4488 في المتوسط عبر ستة مسارات و0.4218 في البوابة الكلية، متقدمًا على جميع الأذرع حتى LFM2.5-8B-A1B، ولكن ليس على أكبر ذراعين (Qwen3-8B وgpt-oss-120b). الكفاءة هي ميزة رئيسية: ينتج TwIL-LM3 أقصر التوليدات (482 رمزًا) ومعظم الإجابات في الثانية (32.9 مقابل 4.2 للنموذج 120B). يحسن TwIL-LM3 داخل النطاق بنسبة +26% نسبيًا بينما يحقق أيضًا +0.022 في المتوسط الأساسي خارج النطاق، كونه الذراع الوحيد الذي يحسن في كلا المسارين. يقدم نموذج 1.7B مقايضة مختلفة مع نتائج مختلطة خارج التوزيع. النقاط الرئيسية: TwIL-LM3 وTwIL-LM مخصصان للمنطق الرسمي بموجب ترخيص غير تجاري؛ يتخلف TwIL-LM3 عن gpt-oss-120b في المتوسط عبر ستة مسارات؛ ميزته الحقيقية هي الكفاءة؛ استيفاء WiSE-FT عند λ = 0.25 هو السبب في أن المكاسب داخل النطاق لا تؤدي إلى انهيار الأداء خارج النطاق.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة