शोधमॉडल 🇺🇸 24.07.2026 05:06

Amazon Nova के बेहतरीन ट्यूनिंग के लिए स्व-संशोधित तर्क

Amazon Web ServicesAmazon Web Services
Amazon उन मामलों में पर्यवेक्षित सूक्ष्म-ट्यूनिंग (SFT) के लिए चेन-ऑफ-थॉट ट्रेस उत्पन्न करने के लिए स्व-संशोधित तर्क (SDR) का पता लगा रहा है जहां ऐसे ट्रेस अनुपलब्ध हैं। SDR आधार Amazon Nova 2 Lite मॉडल के अपने तर्क का पुन: उपयोग करता है, विनाशकारी भूल को कम करता है और मानव टिप्पणी के बिना लक्ष्य प्रदर्शन में सुधार करता है।
सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) के साथ किसी मॉडल को फाइन-ट्यून करते समय, उच्च-गुणवत्ता वाले चेन-ऑफ-थॉट (CoT) तर्क ट्रेस बनाना अक्सर अव्यावहारिक होता है। तर्क ट्रेस के बिना, मॉडल तर्क दमन समस्या के कारण अपनी तर्क क्षमता खो सकता है। Amazon सेल्फ-डिस्टिल्ड रीज़निंग (SDR) प्रस्तावित करता है, जो प्रत्येक SFT उदाहरण के लिए तर्क ट्रेस उत्पन्न करने के लिए बेस Amazon Nova 2 Lite मॉडल का उपयोग करता है, फिर उन्हें मूल आउटपुट के साथ जोड़ता है और तर्क मोड के साथ फाइन-ट्यून करता है। SDR को किसी मानव एनोटेशन की आवश्यकता नहीं है, यह डोमेन में लागू होता है, और मॉडल मर्जिंग की तुलना में तर्क क्षमता को अधिक प्रभावी ढंग से संरक्षित करता है। ToolACE, CoCoHD, GovReport, Invoice-OCR, और CaptionGen जैसे बेंचमार्क पर प्रयोगों से पता चलता है कि SDR विनाशकारी भूलने की समस्या को कम करता है, गणित प्रदर्शन को बनाए रखता है (मॉडल मर्जिंग के साथ 68% की तुलना में 70%), और औसतन लक्ष्य प्रदर्शन में 6.5% से अधिक सुधार करता है।
स्रोत: AWS ML blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार