TekoälyturvallisuusTutkimus 🇺🇸 27.07.2026 21:04

Import AI 461: 'Kehitys ei ole oikealla tiellä'; FrontierCode; ja synteettiset tutkimusharjoittelijat

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
Tutkijat Ison-Britannian tekoälyturvallisuusinstituutista ja Timaeus-yhteisöstä perustavat Sequent-nimisen voittoa tavoittelemattoman organisaation, joka pyrkii kehittämään periaatteellisia kohdistustekniikoita superälykkäälle tekoälylle. Organisaatio kerää aluksi 100–150 miljoonaa dollaria. Cognition julkaisee FrontierCode-nimisen vaativan koodausvertailuarvon, jossa Claude Opus 4.8 saavuttaa 13,4 prosentin tuloksen vaikeimmalla tasolla. Xiaomi julkaisee yksityiskohtia MiMo-V2.5-Pro-UltraSpeed-mallista, joka on biljoonan parametrin malli ja saavuttaa 1000 tokenia sekunnissa rinnakkaissuunnittelun ja kvantisoinnin avulla. Uusi vertailuarvo, AARRI-Bench, arvioi tekoälyjärjestelmiä perustason tutkimustehtävissä.
Uusi voittoa tavoittelematon tutkimusorganisaatio Sequent on perustettu yhdistämään Ison-Britannian tekoälyturvallisuusinstituutin (UK AI Security Institute) ja linjausteoria-startup Timaeuksen tutkijoiden voimat. Organisaation tavoitteena on kehittää linjaustekniikoita superälykkäille tekoälyjärjestelmille. Sequent pyrkii keräämään aluksi 100–150 miljoonaa dollaria ja kasvamaan 40–80 työntekijään. Se tutkii monipuolisia tutkimussuuntia, kuten skaalautuvaa valvontaa, oppimisteoriaa, heuristisia argumentteja, peliteoriaa ja persoonia, saavuttaakseen periaatteellisen luottamuksen linjaukseen. Cognition, Devinin takana oleva yritys, julkaisi FrontierCode-nimisen koodausvertailuarvon, joka sisältää 150 tehtävää kolmessa vaikeustasossa (Diamond, Main, Extended). Vertailuarvo mittaa koodin laatua, yhdistettävyyttä ja koodikantastandardien noudattamista. Claude Opus 4.8 saavutti vain 13,4 prosentin tuloksen Diamond-tasolla, mikä osoittaa, että parannettavaa on runsaasti. Xiaomi esitteli MiMo-V2.5-Pro-UltraSpeed-mallin, joka on biljoona parametria sisältävä kielimalli. Se saavuttaa 1000 tokenia sekunnissa päätelmänopeuden kahdeksan grafiikkaprosessorin kuluttajaluokan solmussa käyttäen nelibittistä liukulukukvantisointia, spekulatiivista dekoodausta DFlashin avulla ja startup Tile AI:n TileRT-ohjelmistoa. Xi'anin Jiaotongin yliopiston ja Xidianin yliopiston tutkijat kehittivät AARR-vertailuarvot (Act As a Real Researcher), alkaen AARRI-Benchistä. Nämä vertailuarvot arvioivat tekoälyjärjestelmiä aloittelijan tutkimustehtävissä. Parhaiten suoriutunut järjestelmä, Claude-Opus-4.7 yhdistettynä Mini-Swe-Ageen, sai 42,13 prosentin tuloksen Science-skenaariossa.
Lähde: Import AI — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset