PSU और Duke के शोधकर्ताओं ने मल्टी-एजेंट सिस्टम के लिए स्वचालित विफलता आरोपण प्रस्तुत किया
Google DeepMind
Meta
OpenAI
DeepSeek
पेन स्टेट यूनिवर्सिटी और ड्यूक यूनिवर्सिटी के शोधकर्ताओं ने, Google DeepMind और अन्य के सहयोग से, एलएलएम मल्टी-एजेंट सिस्टम में स्वचालित विफलता आरोपण की समस्या को औपचारिक रूप दिया। उन्होंने पहला बेंचमार्क डेटासेट, Who&When, बनाया और कई विधियों का मूल्यांकन किया, जिसमें पाया गया कि सबसे अच्छे तरीके भी जिम्मेदार एजेंट की पहचान में केवल 53.5% सटीकता प्राप्त करते हैं।
पेंसिल्वेनिया स्टेट यूनिवर्सिटी और ड्यूक यूनिवर्सिटी की एक टीम ने, गूगल डीपमाइंड, यूनिवर्सिटी ऑफ वॉशिंगटन, मेटा, NTU (नानयांग टेक्नोलॉजिकल यूनिवर्सिटी) और ओरेगॉन स्टेट यूनिवर्सिटी के शोधकर्ताओं के साथ मिलकर, एक नई शोध समस्या परिभाषित की है: LLM-संचालित मल्टी-एजेंट सिस्टम में स्वचालित विफलता आरोपण। उन्होंने पहला बेंचमार्क डेटासेट, Who&When बनाया, जिसमें 127 मल्टी-एजेंट सिस्टम के विफलता लॉग शामिल हैं, जिनमें मानव द्वारा जिम्मेदार एजेंट, निर्णायक त्रुटि चरण और प्राकृतिक भाषा में स्पष्टीकरण के एनोटेशन हैं। शोधकर्ताओं ने तीन आरोपण विधियाँ विकसित और मूल्यांकित कीं: ऑल-एट-वन्स, स्टेप-बाय-स्टेप, और बाइनरी सर्च। GPT-4o का उपयोग करके किए गए प्रयोगों में पाया गया कि सर्वश्रेष्ठ एकल विधि ने जिम्मेदार एजेंट की पहचान में केवल 53.5% सटीकता और त्रुटि चरण का पता लगाने में 14.2% सटीकता प्राप्त की। हाइब्रिड दृष्टिकोणों ने प्रदर्शन में सुधार किया, लेकिन अधिक कम्प्यूटेशनल लागत पर। यह पेपर ICML 2025 में स्पॉटलाइट प्रेजेंटेशन के रूप में स्वीकार किया गया है, और कोड और डेटासेट ओपन-सोर्स किए गए हैं।
स्रोत: Synced —
मूल
