QuantCode-Bench: uusi vertailuarvo suurten kielimallien kyvylle tuottaa suoritettavia algoritmisia kaupankäyntistrategioita
OpenAI
Anthropic
Google/DeepMind
xAI
DeepSeek
Alibaba/Qwen
Moonshot AI
Tutkijat kehittivät QuantCode-Bench-vertailuarvon arvioimaan, kuinka hyvin suuret kielimallit pystyvät tuottamaan suoritettavia algoritmisia kaupankäyntistrategioita tekstimuotoisista määrittelyistä. Vertailuarvo arvioi paitsi koodin oikeellisuuden myös semanttisen yhdenmukaisuuden alkuperäisen kaupankäynti-idean kanssa neljän vaiheen avulla: kääntäminen, backtestaus, kaupankäyntisignaalien tuottaminen ja tuomarin vahvistus.
QuantCode-Bench on vertailutesti, joka on suunniteltu arvioimaan suurten kielimallien kykyä tuottaa suoritettavia algoritmisia kaupankäyntistrategioita luonnollisista kielikuvauksista. Se sisältää 400 tehtävää, jotka on kerätty Redditistä, TradingView'sta, StackExchange'sta, GitHubista ja synteettisestä datasta, ja ne kattavat kolme vaikeustasoa. Arviointiputki koostuu neljästä vaiheesta: käännös (syntaksin tarkistus), takaisintestaus (ajonaikainen suoritus), kaupankäynti (vähintään yksi toteutettu kauppa) ja arviointi (semanttinen yhteensopivuus arvioivan kielimallin avulla). Tuettuna on kaksi tilaa: kertakäyttöinen (yksi generointi) ja agenttipohjainen monikierroksinen (enintään 10 iteratiivista parannusta palautteen avulla). Tulokset osoittavat, että vaikka lähes kaikki vahvat mallit saavuttavat täydellisen käännöksen kertakäyttöisessä tilassa, lopulliset arviointiläpäisyprosentit vaihtelevat suuresti, ja GPT-5.5 johtaa 82,5 prosentin osuudella. Monikierroksisessa tilassa suorituskyky paranee dramaattisesti, ja GPT-5.5 saavuttaa 98,8 prosentin arviointiläpäisyn. Vertailutesti korostaa, että syntaktinen oikeellisuus ei riitä alakohtaiseen koodin generointiin, ja mallien on ymmärrettävä kaupankäynnin aluetta, ohjelmointirajapinnan semantiikkaa ja kyettävä operationalisoimaan epämääräisiä kuvauksia.
Lähde: Habr — хаб NLP —
Alkuperäinen
