AI-veiligheidOnderzoek 🇩🇪 13.08.2026 13:02

AI-onderzoekers waarschuwden voor autonome zelfverbetering en zien nu eerste mijlpalen bereikt

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind Sakana AISakana AI
IAPS-fellow Severin Field ondervroeg 25 onderzoekers van OpenAI, Anthropic, Google DeepMind, Meta en Amerikaanse universiteiten over recursieve zelfverbetering (RSI). In een blogpost meldt hij dat verschillende van de door hen genoemde mijlpalen nu zijn bereikt, zoals prestaties op gouden niveau bij de Wiskunde-olympiade en door AI gegenereerde workshopartikelen. Field waarschuwt ook voor een 'incentive-omslag' die ertoe zou kunnen leiden dat krachtige modellen intern worden gehouden.
In een blogpost voor de nieuwsbrief The Attack Surface vat Severin Field de resultaten samen van een interviewstudie die eind zomer 2025 is uitgevoerd. Van de 25 ondervraagde onderzoekers plaatsten er 20 de automatisering van AI-onderzoek in de top van meest ernstige en urgente AI-risico's. Recursieve zelfverbetering (RSI) verwijst naar een systeem dat goed genoeg is in AI-ontwikkeling om een sterkere versie van zichzelf te bouwen, een cyclus die zich zou kunnen voortzetten. Field stelt dat RSI niet langer slechts een marketingbelofte is. Als maatstaf voor vooruitgang noemden de geïnterviewden herhaaldelijk de Task Horizon-benchmark van de non-profitorganisatie METR, die laat zien dat de lengte van taken die AI-agenten autonoom kunnen voltooien sinds 2019 ongeveer elke zes maanden verdubbelt (sommige analisten beweren elke vier maanden sinds 2024). Het punt van discussie is niet zelfverbetering zelf, maar de recursiviteit ervan – of verbeteringen zullen uitgroeien tot een zichzelf in stand houdende lus. Sceptici zeggen dat er een doorbraak nodig is op het gebied van geheugen, creativiteit of het onderscheiden van ware van onware hypothesen, omdat er geen trainingsdata of oplossingssleutels zijn voor paradigma-veranderende ideeën. Sinds de interviews zijn er verschillende mijlpalen bereikt: OpenAI en Google DeepMind bereikten gouden-medailleprestaties bij de Wiskundeolympiade, Sakana's 'AI Scientist' produceerde een peer-reviewed workshopartikel, Andrej Karpathy bouwde een agentopstelling die onafhankelijk trainingscycli uitvoert, en Anthropic meldde dat zijn Claude-model nu meer dan 80% van de code schrijft voor zijn eigen productiecodebase. Slechts vier van de twintig respondenten verwachten dat onderzoeksbekwame modellen als openbare producten verschijnen; de helft verwacht uitsluitend intern gebruik, en de rest verwacht gedistilleerde openbare versies. Field beschrijft een mogelijke 'prikkelomkering': zodra AI zijn eigen onderzoek merkbaar versnelt, wordt terughouden waardevoller dan verkopen. Als bewijs noemt hij een beveiligingsincident met een intern OpenAI-model dat in juli 2026 uit zijn testomgeving ontsnapte en Hugging Face in gevaar bracht, en de tijdelijke toegangsbeperking van de Amerikaanse overheid tot Anthropic's Claude Mythos. Field leidt drie aanbevelingen af: hoorzittingen die CEO's en onderzoekers onder ede ondervragen over geautomatiseerd AI-onderzoek, een door de staat gerunde Task Horizon-benchmark met een anoniem interviewprogramma bij het Centrum voor AI-veiligheid en -innovatie, en onderzoek naar verificatie van internationale AI-overeenkomsten, zonder welke deals met China praktisch onafdwingbaar zouden zijn. Hij merkt op dat het debat nauwelijks Washington heeft bereikt terwijl laboratoria blijven racen. Recentelijk ondertekenden 1.224 medewerkers van toonaangevende AI-bedrijven, waaronder hoofdwetenschappers van OpenAI en Meta, een open verklaring waarin ze waarschuwen dat hun bedrijven binnenkort AI-onderzoek zouden kunnen automatiseren.
Bron: The Decoder (DE) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws