AI Import 461: 'Afstemming niet op de goede weg'; FrontierCode; en synthetische wetenschapsstagiairs
Cognition
Alibaba/Qwen
Anthropic
OpenAI
Onderzoekers van UK AISI en Timaeus richtten de non-profitorganisatie Sequent op om afstemmingsmethoden te ontwikkelen die de veiligheid van superintelligente systemen waarborgen. Cognition bracht de FrontierCode-benchmark uit voor het evalueren van codekwaliteit, waarbij het beste model, Claude Opus 4.8, slechts 13,4% scoorde op het moeilijkste niveau. Ook gepresenteerd worden de ChinaHeritaQA-dataset voor het evalueren van VLM-culturele kennis over Chinese UNESCO-sites en het Xiaomi MiMo-V2.5-Pro-UltraSpeed-model met een generatiesnelheid van 1000 tokens per seconde.
Voormalige medewerkers van de afdeling alignment van het UK AI Security Institute en de startup Timaeus hebben de handen ineengeslagen om de non-profitorganisatie Sequent op te richten, die technieken voor alignment zal ontwikkelen die een hoge mate van vertrouwen bieden in de veiligheid van superintelligente AI. Sequent is van plan om 100 tot 150 miljoen dollar aan initiële financiering op te halen en 40 tot 80 medewerkers aan te nemen, met een focus op een portfolio van onderzoeksrichtingen: schaalbare supervisie, leertheorie, heuristische argumenten, speltheorie en personae. Cognition, de maker van Devin, heeft de benchmark FrontierCode gepresenteerd, bestaande uit 150 codeerschrijftaken, verdeeld over drie moeilijkheidsniveaus. Het beste resultaat op Diamond-niveau werd behaald door Claude Opus 4.8 met 13,4%, wat de moeilijkheid van de benchmark bevestigt. Op de Chinese markt heeft Xiaomi het model MiMo-V2.5-Pro-UltraSpeed aangekondigd met 1 biljoen parameters en een generatiesnelheid van 1000 tokens per seconde, dankzij gezamenlijke optimalisatie van architectuur en software, waaronder FP4-kwantificatie en speculatieve decodering DFlash. Onderzoekers van meerdere universiteiten hebben ChinaHeritaQA gecreëerd, een multimodale benchmark bestaande uit 2279 afbeeldingen van 51 UNESCO-werelderfgoedlocaties in China en 14.133 vragen. Het beste open model, Qwen-VL-8B-Instruct, behaalde een nauwkeurigheid van 81%, waarmee het de menselijke 67% overtrof. Daarnaast hebben onderzoekers van de Xi'an Jiaotong-universiteit en de Xidian-universiteit de benchmarks AARR ontwikkeld, die het vermogen van AI-agenten beoordelen om taken uit te voeren die typisch zijn voor een wetenschappelijke stagiair; de beste agent was Claude-Opus-4.7 met Mini-Swe-Age.
Bron: Import AI —
origineel
