AI Import 461: 'Afstemming niet op de goede weg'; FrontierCode; en synthetische wetenschapsstagiairs
Onderzoekers van UK AISI en Timaeus richtten de non-profitorganisatie Sequent op om afstemmingsmethoden te ontwikkelen die de veiligheid van superintelligente systemen waarborgen. Cognition bracht de FrontierCode-benchmark uit voor het evalueren van codekwaliteit, waarbij het beste model, Claude Opus 4.8, slechts 13,4% scoorde op het moeilijkste niveau. Ook gepresenteerd worden de ChinaHeritaQA-dataset voor het evalueren van VLM-culturele kennis over Chinese UNESCO-sites en het Xiaomi MiMo-V2.5-Pro-UltraSpeed-model met een generatiesnelheid van 1000 tokens per seconde.
Cognition
Alibaba/Qwen
Anthropic
OpenAI
Import AI27.07 · 21:04
