QuantCode-Bench: एलएलएम की एक्ज़ीक्यूटेबल एल्गोरिदमिक ट्रेडिंग रणनीतियाँ बनाने की क्षमता का मूल्यांकन करने वाला नया बेंचमार्क
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
शोधकर्ताओं ने QuantCode-Bench नामक एक बेंचमार्क विकसित किया है, जो बड़े भाषा मॉडलों (एलएलएम) की पाठ्य विवरणों से एक्ज़ीक्यूटेबल एल्गोरिदमिक ट्रेडिंग रणनीतियाँ उत्पन्न करने की क्षमता का आकलन करता है। यह बेंचमार्क चार चरणों—संकलन, बैकटेस्ट, ट्रेड जनरेशन और जज सत्यापन—के माध्यम से कोड की शुद्धता के साथ-साथ मूल ट्रेडिंग विचार के साथ सिमैंटिक संरेखण का मूल्यांकन करता है।
QuantCode-Bench एक बेंचमार्क है जो LLMs की प्राकृतिक भाषा विवरणों से निष्पादन योग्य एल्गोरिथमिक ट्रेडिंग रणनीतियाँ उत्पन्न करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसमें Reddit, TradingView, StackExchange, GitHub और सिंथेटिक डेटा से प्राप्त 400 कार्य शामिल हैं, जो तीन कठिनाई स्तरों को कवर करते हैं। मूल्यांकन पाइपलाइन चार चरणों से बनी है: संकलन (सिंटैक्स जाँच), बैकटेस्ट (रनटाइम निष्पादन), ट्रेड (कम से कम एक ट्रेड निष्पादित), और जज (एक LLM जज के माध्यम से सिमैंटिक संरेखण)। दो मोड समर्थित हैं: एकल-टर्न (एक-बार जनरेशन) और एजेंटिक मल्टी-टर्न (फीडबैक के साथ 10 पुनरावृत्तीय सुधार तक)। परिणाम दर्शाते हैं कि जहाँ लगभग सभी मजबूत मॉडल एकल-टर्न मोड में पूर्ण संकलन प्राप्त कर लेते हैं, वहीं अंतिम जज पास दरें व्यापक रूप से भिन्न होती हैं, जिसमें GPT-5.5 82.5% के साथ अग्रणी है। मल्टी-टर्न मोड में, प्रदर्शन में नाटकीय रूप से सुधार होता है, GPT-5.5 98.8% जज पास तक पहुँचता है। बेंचमार्क इस बात पर प्रकाश डालता है कि सिंटैक्सिक शुद्धता डोमेन-विशिष्ट कोड जनरेशन के लिए अपर्याप्त है, और मॉडल को ट्रेडिंग डोमेन, API सिमैंटिक्स को समझना होगा और अस्पष्ट विवरणों को कार्यान्वित करना होगा।
स्रोत: Habr — хаб NLP —
मूल
