AraştırmaModeller 🇷🇺 27.07.2026 03:03

QuantCode-Bench: Algoritmik Ticaret Stratejileri Üretebilen Büyük Dil Modellerini Değerlendirmek İçin Yeni Bir Kriter

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Araştırmacılar, büyük dil modellerinin (LLM'ler) metinsel belirtimlerden çalıştırılabilir algoritmik ticaret stratejileri üretme yeteneğini değerlendirmek için QuantCode-Bench adlı bir kriter geliştirdi. Bu kriter, yalnızca kod doğruluğunu değil, aynı zamanda orijinal ticaret fikriyle anlamsal uyumu dört aşama aracılığıyla değerlendiriyor: derleme, geriye dönük test, ticaret oluşturma ve hakem doğrulaması.
QuantCode-Bench, LLM'lerin doğal dil açıklamalarından çalıştırılabilir algoritmik ticaret stratejileri üretme yeteneklerini değerlendirmek için tasarlanmış bir kıyaslama aracıdır. Reddit, TradingView, StackExchange, GitHub ve sentetik verilerden alınan 400 görevi içerir ve üç zorluk seviyesini kapsar. Değerlendirme hattı dört aşamadan oluşur: Derleme (sözdizimsel kontrol), Geri Test (çalışma zamanı yürütme), İşlem (en az bir işlem yürütülmesi) ve Yargı (bir LLM yargıcı aracılığıyla anlamsal uyum). Tek turlu (tek seferlik üretim) ve etmen tabanlı çok turlu (geri bildirimle 10'a kadar yinelemeli iyileştirme) olmak üzere iki mod desteklenir. Sonuçlar, hemen hemen tüm güçlü modellerin tek turlu modda mükemmel derleme elde etmesine rağmen, nihai Yargı Geçiş oranlarının büyük farklılıklar gösterdiğini ve GPT-5.5'in %82,5 ile lider olduğunu göstermektedir. Çok turlu modda performans önemli ölçüde iyileşir ve GPT-5.5 %98,8 Yargı Geçiş oranına ulaşır. Kıyaslama, sözdizimsel doğruluğun alana özgü kod üretimi için yetersiz olduğunu ve modellerin ticaret alanını, API anlambilimini anlaması ve belirsiz açıklamaları işlevsel hale getirmesi gerektiğini vurgulamaktadır.
Kaynak: Habr — хаб NLP — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler