AI-veiligheidOnderzoek 🇺🇸 27.07.2026 21:04

Import AI 461: 'Alignment is niet op schema'; FrontierCode; en synthetische onderzoeksstagiairs

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
Onderzoekers van het UK AI Security Institute en Timaeus lanceren Sequent, een non-profitorganisatie die zich richt op het ontwikkelen van principegetrouwe alignmenttechnieken voor superintelligente AI, en haalt initieel $100-150 miljoen op. Cognition brengt FrontierCode uit, een moeilijke codeerbenchmark waar Claude Opus 4.8 13,4% scoort op de moeilijkste categorie. Xiaomi publiceert details over MiMo-V2.5-Pro-UltraSpeed, een model met 1 biljoen parameters dat 1000 tokens per seconde haalt door middel van co-ontwerp en kwantisering. Een nieuwe benchmark, AARRI-Bench, evalueert AI-systemen op taken op instapniveau in onderzoek.
Een nieuwe non-profitorganisatie genaamd Sequent is opgericht door onderzoekers van het UK AI Security Institute en de alignment theory-startup Timaeus om alignment-technieken te ontwikkelen voor superintelligente AI-systemen. Sequent streeft ernaar om aanvankelijk 100-150 miljoen dollar op te halen en te groeien naar 40-80 werknemers, waarbij diverse onderzoeksrichtingen worden nagestreefd, zoals schaalbare supervisie, leertheorie, heuristische argumenten, speltheorie en persona's om principiële zekerheid te verkrijgen over alignment. Cognition, het bedrijf achter Devin, heeft FrontierCode uitgebracht, een codeerbenchmark met 150 taken in drie moeilijkheidsniveaus (Diamant, Hoofd, Uitgebreid) die de codekwaliteit, samenvoegbaarheid en naleving van codebase-standaarden meet; Claude Opus 4.8 behaalde slechts 13,4% op het Diamant-niveau, wat duidt op aanzienlijke ruimte voor verbetering. Xiaomi heeft MiMo-V2.5-Pro-UltraSpeed geïntroduceerd, een LLM met 1 biljoen parameters dat 1000 tokens per seconde inferentie bereikt op een 8-GPU commodity-node met behulp van FP4-kwantificatie, speculatieve decodering via DFlash en TileRT-software van de startup Tile AI. Onderzoekers van de Xi'an Jiaotong Universiteit en de Xidian Universiteit hebben de AARR-benchmarks (Act As a Real Researcher) ontwikkeld, te beginnen met AARRI-Bench, om AI-systemen te evalueren op instaponderzoekstaken; het best presterende systeem, Claude-Opus-4.7 met Mini-Swe-Age, scoorde 42,13% op het Science-scenario.
Bron: Import AI — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws