TutkimusMallit 🇷🇺 27.07.2026 03:03

QuantCode-Bench: uusi vertailuarvo suurten kielimallien kyvylle tuottaa suoritettavia algoritmisia kaupankäyntistrategioita

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind xAIxAI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Tutkijat kehittivät QuantCode-Bench-vertailuarvon arvioimaan, kuinka hyvin suuret kielimallit pystyvät tuottamaan suoritettavia algoritmisia kaupankäyntistrategioita tekstimuotoisista määrittelyistä. Vertailuarvo arvioi paitsi koodin oikeellisuuden myös semanttisen yhdenmukaisuuden alkuperäisen kaupankäynti-idean kanssa neljän vaiheen avulla: kääntäminen, backtestaus, kaupankäyntisignaalien tuottaminen ja tuomarin vahvistus.
QuantCode-Bench on vertailutesti, joka on suunniteltu arvioimaan suurten kielimallien kykyä tuottaa suoritettavia algoritmisia kaupankäyntistrategioita luonnollisista kielikuvauksista. Se sisältää 400 tehtävää, jotka on kerätty Redditistä, TradingView'sta, StackExchange'sta, GitHubista ja synteettisestä datasta, ja ne kattavat kolme vaikeustasoa. Arviointiputki koostuu neljästä vaiheesta: käännös (syntaksin tarkistus), takaisintestaus (ajonaikainen suoritus), kaupankäynti (vähintään yksi toteutettu kauppa) ja arviointi (semanttinen yhteensopivuus arvioivan kielimallin avulla). Tuettuna on kaksi tilaa: kertakäyttöinen (yksi generointi) ja agenttipohjainen monikierroksinen (enintään 10 iteratiivista parannusta palautteen avulla). Tulokset osoittavat, että vaikka lähes kaikki vahvat mallit saavuttavat täydellisen käännöksen kertakäyttöisessä tilassa, lopulliset arviointiläpäisyprosentit vaihtelevat suuresti, ja GPT-5.5 johtaa 82,5 prosentin osuudella. Monikierroksisessa tilassa suorituskyky paranee dramaattisesti, ja GPT-5.5 saavuttaa 98,8 prosentin arviointiläpäisyn. Vertailutesti korostaa, että syntaktinen oikeellisuus ei riitä alakohtaiseen koodin generointiin, ja mallien on ymmärrettävä kaupankäynnin aluetta, ohjelmointirajapinnan semantiikkaa ja kyettävä operationalisoimaan epämääräisiä kuvauksia.
Lähde: Habr — хаб NLP — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset