Nghiên cứuMô hình 🇷🇺 27.07.2026 04:05

Finam AI Lab cập nhật chuẩn tài chính FINESSE-Bench cho các mô hình ngôn ngữ lớn

AnthropicAnthropic Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind MiniMaxMiniMax OpenAIOpenAI MetaMeta DeepSeekDeepSeek MistralMistral СберСбер ЯндексЯндекс Т-БанкТ-Банк
Phòng thí nghiệm Trí tuệ Nhân tạo của Finam đã phát hành phiên bản cập nhật của chuẩn đánh giá tài chính FINESSE-Bench. Phiên bản mới bổ sung bộ dữ liệu phân tích kỹ thuật CFTe cấp độ 1, sửa 169 câu hỏi CFA cấp độ 1, cải thiện tính toán chỉ số bằng phương pháp bootstrapping, và mở rộng tập mô hình lên 33 trong bảng so sánh.
Phòng thí nghiệm Trí tuệ Nhân tạo Finam đã phát hành bản cập nhật cho bộ chuẩn tài chính FINESSE-Bench, được thiết kế để đánh giá kiến thức và kỹ năng của các mô hình ngôn ngữ lớn (Large Language Models - LLMs) trong lĩnh vực tài chính. Các thay đổi chính bao gồm: sửa 169 câu hỏi có vấn đề trong tập dữ liệu CFA cấp độ 1; bổ sung tập dữ liệu mới dạng CFTe cấp độ 1 với 781 câu hỏi về nền tảng phân tích kỹ thuật; chuyển sang tính toán khoảng tin cậy bằng phương pháp bootstrapping để so sánh mô hình chính xác hơn; sử dụng bootstrapping phân tầng để tổng hợp kết quả theo các nhóm chuẩn; đánh giá riêng khả năng phân biệt và độ bão hòa của tập dữ liệu (kết quả cho thấy hầu hết các câu hỏi FINESSE đều nằm trong vùng trung gian, mang lại giá trị chẩn đoán tốt). Nhóm mô hình đã được mở rộng: tổng cộng 66 hệ thống đã được kiểm tra, trong đó 49 hệ thống có phủ sóng đầy đủ trên tất cả 11 chuẩn (8 FINESSE + 3 công khai) và 33 mô hình được đưa vào các bảng chính. Kết quả hàng đầu đạt được bởi GPT-5.5 (0,906 ở dạng thi, 0,876 ở giao dịch/phân tích kỹ thuật), Claude Opus 4.8 (0,860 ở dạng thi, 0,856 ở giao dịch/phân tích kỹ thuật) và các mô hình khác.
Nguồn: Habr — хаб NLP — bản gốc
Bài viết liên quan trước đây ↓
Tin mới