الأبحاثالنماذج 🇷🇺 27.07.2026 04:05

مختبر Finam للذكاء الاصطناعي يحدّث معيار FINESSE-Bench المالي لنماذج LLM

AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind MiniMaxMiniMax OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral СберСбер ЯндексЯндекс Т-БанкТ-Банк
أصدر مختبر الذكاء الاصطناعي التابع لشركة Finam نسخة محدثة من المعيار المالي FINESSE-Bench. تضيف النسخة الجديدة مجموعة بيانات للتحليل الفني على مستوى CFTe Level 1، وتصلح 169 سؤالاً على مستوى CFA Level 1، وتحسن حساب المقاييس باستخدام تقنية bootstrapping، وتوسع مجموعة النماذج إلى 33 في جداول المقارنة.
أطلق مختبر الذكاء الاصطناعي المالي التابع لشركة Finam تحديثًا لمعيار FINESSE-Bench المالي، المصمم لتقييم معرفة ومهارات نماذج اللغة الكبيرة (LLMs) في المجال المالي. تشمل التغييرات الرئيسية: إصلاح 169 سؤالًا إشكاليًا في مجموعة بيانات مستوى CFA-1؛ إضافة مجموعة بيانات جديدة لمستوى CFTe-1 تحتوي على 781 سؤالًا حول أساسيات التحليل الفني؛ الانتقال إلى حساب فترات الثقة عبر طريقة bootstrap لمقارنة أكثر قوة بين النماذج؛ استخدام bootstrap الطبقي لتجميع النتائج حسب مجموعات المعايير؛ تقييم منفصل لقوة التمييز والتشبع لمجموعات البيانات (حيث وُجد أن معظم أسئلة FINESSE تقع في المنطقة المتوسطة، مما يوفر قيمة تشخيصية جيدة). تم توسيع مجموعة النماذج: تم اختبار 66 نظامًا، منها 49 نظامًا تغطي كامل المعايير البالغ عددها 11 معيارًا (8 معايير FINESSE + 3 معايير عامة)، وتم إدراج 33 نموذجًا في الجداول الرئيسية. حققت أفضل النتائج نماذج GPT-5.5 (0.906 في الاختبارات الشبيهة بالامتحانات، 0.876 في التداول/التحليل الفني)، وClaude Opus 4.8 (0.860 في الاختبارات الشبيهة بالامتحانات، 0.856 في التداول/التحليل الفني)، وغيرها.
المصدر: Habr — хаб NLP — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة