الاستدلال الذاتي المقطر لضبط أمازون نوفا
Amazon Web Services
قدمت أمازون طريقة الاستدلال الذاتي المقطر (SDR) للضبط الدقيق الخاضع للإشراف (SFT) لنماذج أمازون نوفا 2. تولد SDR مسارات استدلال متسلسلة (CoT) لمجموعات البيانات التي تفتقر إليها، باستخدام النموذج نفسه. يعالج هذا مشكلة كبت الاستدلال ويقلل من النسيان الكارثي، مما يحسن الأداء المستهدف مع الاحتفاظ بالقدرات العامة.
في مقال على مدونة AWS لتعلّم الآلة، تم استكشاف مشكلة تثبيط التفكير المنطقي عند الضبط الدقيق الخاضع للإشراف (SFT) للنماذج على بيانات لا تحتوي على سلسلة أفكار (CoT). يؤدي الضبط الدقيق الخاضع للإشراف دون سلسلة أفكار إلى فقدان النموذج لقدرته على التفكير المنطقي حتى عند تنشيط وضع التفكير، مما يسبب نسيانًا كارثيًا. تم اقتراح طريقة التفكير الذاتي المستخلص (SDR)، التي تُولد في المرحلة الأولى سلسلة أفكار باستخدام نموذج التفكير الأساسي (Amazon Nova 2 Lite)، ثم تُكمل بيانات التدريب بهذه المسارات وتُجري الضبط الدقيق الخاضع للإشراف مع تفعيل وضع التفكير. أظهرت التجارب على خمسة معايير (ToolACE وCoCoHD وGovReport وInvoice-OCR وCaptionGen) أن طريقة SDR تُحسّن الأداء المستهدف بنسبة 6.5% في المتوسط مقارنة بدمج النماذج البسيط، مع الحفاظ على الدقة الرياضية عند 70% مقابل 68% للدمج. لا تتطلب طريقة SDR تعليقات يدوية، وتعمل مع أي مجالات، كما أنها أكثر فعالية من دمج النماذج في منع النسيان الكارثي. تستخدم الطريقة النموذج نفسه كمصدر للتفكير، مما يتوافق مع مبادئ الاستخلاص الذاتي.
المصدر: AWS ML blog —
الأصلي
