RisetModel 🇷🇺 27.07.2026 03:03

QuantCode-Bench: Tolok Ukur Baru untuk Mengevaluasi Kemampuan LLM dalam Menghasilkan Strategi Perdagangan Algoritmik yang Dapat Dieksekusi

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Para peneliti mengembangkan QuantCode-Bench, sebuah tolok ukur untuk menilai seberapa baik model bahasa besar (LLM) dapat menghasilkan strategi perdagangan algoritmik yang dapat dieksekusi dari spesifikasi tekstual. Tolok ukur ini tidak hanya mengevaluasi kebenaran kode tetapi juga keselarasan semantik dengan ide perdagangan asli melalui empat tahap: kompilasi, pengujian ulang, pembuatan perdagangan, dan verifikasi penilai.
QuantCode-Bench adalah tolok ukur yang dirancang untuk mengevaluasi kemampuan LLM dalam menghasilkan strategi perdagangan algoritmik yang dapat dieksekusi dari deskripsi bahasa alami. Tolok ukur ini berisi 400 tugas yang berasal dari Reddit, TradingView, StackExchange, GitHub, dan data sintetis, yang mencakup tiga tingkat kesulitan. Jalur evaluasi terdiri dari empat tahap: Compilation (pemeriksaan sintaksis), Backtest (eksekusi waktu proses), Trade (setidaknya satu perdagangan dieksekusi), dan Judge (keselarasan semantik melalui hakim LLM). Dua mode didukung: single-turn (generasi satu langkah) dan agentic multi-turn (hingga 10 penyempurnaan berulang dengan umpan balik). Hasil menunjukkan bahwa sementara hampir semua model kuat mencapai kompilasi sempurna dalam mode single-turn, tingkat kelulusan Judge akhir sangat bervariasi, dengan GPT-5.5 memimpin di 82,5%. Dalam mode multi-turn, kinerja meningkat secara dramatis, dengan GPT-5.5 mencapai 98,8% kelulusan Judge. Tolok ukur ini menyoroti bahwa kebenaran sintaksis tidak cukup untuk pembuatan kode khusus domain, dan bahwa model harus memahami domain perdagangan, semantik API, dan mengoperasionalkan deskripsi yang tidak jelas.
Sumber: Habr — хаб NLP — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru