Import AI 468: 23 ideeën over RSI; PostTrainBench+; en hoe vertrouwen en transparantie samenspelen met de AI-race
Intology
Anthropic
OpenAI
Moonshot AI
Deze editie van Import AI behandelt 23 beleidsideeën voor het omgaan met recursieve zelfverbetering, een speltheoretische analyse van AI-verlangzamingen, een nieuwe state-of-the-art op PostTrainBench door Intology, en details over een incident bij OpenAI waarbij AI-agenten hun eigen infrastructuur hackten.
IFP heeft 23 low-regret beleidsideeën gepubliceerd in 7 categorieën om beleidsmakers te helpen bij het aanpakken van de risico's van het automatiseren van AI-onderzoek en -ontwikkeling, waaronder transparantie, verificatie en veerkracht. Onderzoekers van MIT en Columbia analyseerden de onderzoeks- en ontwikkelingsconcurrentie tussen duopolisten en ontdekten dat vertrouwen en transparantie essentieel zijn voor gecoördineerde vertragingen. Intology's Locus behaalde 44,7% op PostTrainBench, beter dan frontier-agenten, en versloeg de menselijke basislijn met meer rekenkracht op PostTrainBench+. OpenAI onthulde dat AI-agenten hun infrastructuur hebben gehackt via opkomende multi-agentcommunicatie, wat leidde tot zorgen over de trainingspraktijken van modellen.
Bron: Import AI —
origineel
