शोधमॉडल 🇷🇺 27.07.2026 03:03

QuantCode-Bench: एलएलएम की एक्ज़ीक्यूटेबल एल्गोरिदमिक ट्रेडिंग रणनीतियाँ बनाने की क्षमता का मूल्यांकन करने वाला नया बेंचमार्क

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
शोधकर्ताओं ने QuantCode-Bench नामक एक बेंचमार्क विकसित किया है, जो बड़े भाषा मॉडलों (एलएलएम) की पाठ्य विवरणों से एक्ज़ीक्यूटेबल एल्गोरिदमिक ट्रेडिंग रणनीतियाँ उत्पन्न करने की क्षमता का आकलन करता है। यह बेंचमार्क चार चरणों—संकलन, बैकटेस्ट, ट्रेड जनरेशन और जज सत्यापन—के माध्यम से कोड की शुद्धता के साथ-साथ मूल ट्रेडिंग विचार के साथ सिमैंटिक संरेखण का मूल्यांकन करता है।
QuantCode-Bench एक बेंचमार्क है जो LLMs की प्राकृतिक भाषा विवरणों से निष्पादन योग्य एल्गोरिथमिक ट्रेडिंग रणनीतियाँ उत्पन्न करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसमें Reddit, TradingView, StackExchange, GitHub और सिंथेटिक डेटा से प्राप्त 400 कार्य शामिल हैं, जो तीन कठिनाई स्तरों को कवर करते हैं। मूल्यांकन पाइपलाइन चार चरणों से बनी है: संकलन (सिंटैक्स जाँच), बैकटेस्ट (रनटाइम निष्पादन), ट्रेड (कम से कम एक ट्रेड निष्पादित), और जज (एक LLM जज के माध्यम से सिमैंटिक संरेखण)। दो मोड समर्थित हैं: एकल-टर्न (एक-बार जनरेशन) और एजेंटिक मल्टी-टर्न (फीडबैक के साथ 10 पुनरावृत्तीय सुधार तक)। परिणाम दर्शाते हैं कि जहाँ लगभग सभी मजबूत मॉडल एकल-टर्न मोड में पूर्ण संकलन प्राप्त कर लेते हैं, वहीं अंतिम जज पास दरें व्यापक रूप से भिन्न होती हैं, जिसमें GPT-5.5 82.5% के साथ अग्रणी है। मल्टी-टर्न मोड में, प्रदर्शन में नाटकीय रूप से सुधार होता है, GPT-5.5 98.8% जज पास तक पहुँचता है। बेंचमार्क इस बात पर प्रकाश डालता है कि सिंटैक्सिक शुद्धता डोमेन-विशिष्ट कोड जनरेशन के लिए अपर्याप्त है, और मॉडल को ट्रेडिंग डोमेन, API सिमैंटिक्स को समझना होगा और अस्पष्ट विवरणों को कार्यान्वित करना होगा।
स्रोत: Habr — хаб NLP — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार