QuantCode-Bench: معيار جديد لتقييم قدرة نماذج اللغة الكبيرة على توليد استراتيجيات تداول خوارزمية قابلة للتنفيذ
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
طور الباحثون معيار QuantCode-Bench لتقييم مدى قدرة نماذج اللغة الكبيرة (LLMs) على توليد استراتيجيات تداول خوارزمية قابلة للتنفيذ من المواصفات النصية. يقيم المعيار ليس فقط صحة الكود ولكن أيضًا التوافق الدلالي مع فكرة التداول الأصلية من خلال أربع مراحل: التجميع، الاختبار الخلفي، توليد الصفقات، والتحقق بواسطة الحكم.
يُعد QuantCode-Bench معيارًا مصممًا لتقييم قدرة نماذج اللغة الكبيرة على إنشاء استراتيجيات تداول خوارزمية قابلة للتنفيذ من أوصاف باللغة الطبيعية. يحتوي على 400 مهمة مستمدة من Reddit وTradingView وStackExchange وGitHub وبيانات اصطناعية، تغطي ثلاثة مستويات صعوبة. تتكون عملية التقييم من أربع مراحل: التجميع (التحقق النحوي)، الاختبار الخلفي (تنفيذ وقت التشغيل)، التداول (تنفيذ صفقة واحدة على الأقل)، والحكم (التحقق من التوافق الدلالي عبر نموذج حكم). يتم دعم وضعين: أحادي الجولة (توليد لمرة واحدة) ومتعدد الجولات مع وكيل (حتى 10 تحسينات تكرارية مع ردود فعل). تظهر النتائج أنه بينما تحقق جميع النماذج القوية تقريبًا تجميعًا مثاليًا في الوضع أحادي الجولة، تختلف نسب اجتياز مرحلة الحكم بشكل كبير، حيث يتصدر GPT-5.5 بنسبة 82.5%. في الوضع متعدد الجولات، يتحسن الأداء بشكل كبير، حيث يصل GPT-5.5 إلى 98.8% في اجتياز مرحلة الحكم. يسلط المعيار الضوء على أن الصحة النحوية غير كافية لتوليد التعليمات البرمجية الخاصة بالمجال، وأن النماذج يجب أن تفهم مجال التداول ودلالات واجهة برمجة التطبيقات وتترجم الأوصاف الغامضة إلى أفعال.
المصدر: Habr — хаб NLP —
الأصلي
