الأبحاثالنماذج 🇷🇺 27.07.2026 03:03

QuantCode-Bench: معيار جديد لتقييم قدرة نماذج اللغة الكبيرة على توليد استراتيجيات تداول خوارزمية قابلة للتنفيذ

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
طور الباحثون معيار QuantCode-Bench لتقييم مدى قدرة نماذج اللغة الكبيرة (LLMs) على توليد استراتيجيات تداول خوارزمية قابلة للتنفيذ من المواصفات النصية. يقيم المعيار ليس فقط صحة الكود ولكن أيضًا التوافق الدلالي مع فكرة التداول الأصلية من خلال أربع مراحل: التجميع، الاختبار الخلفي، توليد الصفقات، والتحقق بواسطة الحكم.
يُعد QuantCode-Bench معيارًا مصممًا لتقييم قدرة نماذج اللغة الكبيرة على إنشاء استراتيجيات تداول خوارزمية قابلة للتنفيذ من أوصاف باللغة الطبيعية. يحتوي على 400 مهمة مستمدة من Reddit وTradingView وStackExchange وGitHub وبيانات اصطناعية، تغطي ثلاثة مستويات صعوبة. تتكون عملية التقييم من أربع مراحل: التجميع (التحقق النحوي)، الاختبار الخلفي (تنفيذ وقت التشغيل)، التداول (تنفيذ صفقة واحدة على الأقل)، والحكم (التحقق من التوافق الدلالي عبر نموذج حكم). يتم دعم وضعين: أحادي الجولة (توليد لمرة واحدة) ومتعدد الجولات مع وكيل (حتى 10 تحسينات تكرارية مع ردود فعل). تظهر النتائج أنه بينما تحقق جميع النماذج القوية تقريبًا تجميعًا مثاليًا في الوضع أحادي الجولة، تختلف نسب اجتياز مرحلة الحكم بشكل كبير، حيث يتصدر GPT-5.5 بنسبة 82.5%. في الوضع متعدد الجولات، يتحسن الأداء بشكل كبير، حيث يصل GPT-5.5 إلى 98.8% في اجتياز مرحلة الحكم. يسلط المعيار الضوء على أن الصحة النحوية غير كافية لتوليد التعليمات البرمجية الخاصة بالمجال، وأن النماذج يجب أن تفهم مجال التداول ودلالات واجهة برمجة التطبيقات وتترجم الأوصاف الغامضة إلى أفعال.
المصدر: Habr — хаб NLP — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة