Finam AI Laboratuvarı, LLM'ler için Finansal Referans FINESSE-Bench'i Güncelledi
Anthropic
Moonshot AI
Google/DeepMind
MiniMax
OpenAI
Meta
DeepSeek
Mistral
Сбер
Яндекс
Т-Банк
Finam'ın Yapay Zeka Laboratuvarı, finansal referans FINESSE-Bench'in güncellenmiş bir sürümünü yayınladı. Yeni sürüm, CFTe benzeri Seviye 1 teknik analiz veri kümesini ekliyor, 169 CFA benzeri Seviye 1 sorusunu düzeltiyor, bootstrapping ile metrik hesaplamasını iyileştiriyor ve karşılaştırma tablolarındaki model havuzunu 33'e genişletiyor.
Finam Yapay Zeka Laboratuvarı, büyük dil modellerinin finans alanındaki bilgi ve becerilerini değerlendirmek için tasarlanmış FINESSE-Bench finansal karşılaştırma ölçütünün güncellemesini yayınladı. Temel değişiklikler şunlardır: CFA benzeri Seviye 1 veri setindeki 169 sorunlu sorunun düzeltilmesi; teknik analizin temellerine ilişkin 781 sorudan oluşan yeni bir CFTe benzeri Seviye 1 veri setinin eklenmesi; daha sağlam model karşılaştırması için bootstrap yöntemiyle güven aralığı hesaplamasına geçilmesi; karşılaştırma ölçütü gruplarına göre sonuçları toplamak için tabakalı bootstrap kullanılması; veri seti ayırt edicilik gücü ve doygunluğunun ayrı ayrı değerlendirilmesi (çoğu FINESSE sorusunun orta düzeyde olduğu ve iyi bir tanı değeri sağladığı tespit edilmiştir). Model havuzu genişletildi: toplam 66 sistem test edildi, bunlardan 49'u 11 karşılaştırma ölçütünün tamamında (8 FINESSE + 3 halka açık) tam kapsama sahip ve 33 model ana tablolara dahil edildi. En yüksek sonuçlar GPT-5.5 (sınav benzeri: 0.906, alım satım/teknik analiz: 0.876), Claude Opus 4.8 (sınav benzeri: 0.860, alım satım/teknik analiz: 0.856) ve diğerleri tarafından elde edildi.
Kaynak: Habr — хаб NLP —
orijinal
