Een Enkelvoudig Open Wereldcorpus van Kennis

door dnb66 29.07.2026 12:00

✎ Opiniecolumn — de mening van de auteur, geen nieuwsbericht.

De race om het beste model te trainen kent een limiet — iedereen komt uit bij dezelfde bibliotheek van menselijke kennis. In plaats van dat elke maker opnieuw betaalt voor dezelfde gegevens, hebben we één enkel, juridisch beschermd en vrij te gebruiken wereldcorpus van kennis nodig, gefinancierd door een permanent internationaal fonds.
De race tussen modellen om de beste training te leveren heeft een limiet. Stukje bij beetje zal elke maker de volledige set gegevens samenstellen die een maximaal goed geïnformeerd model nodig heeft. Een weg waarop alle menselijke kennis wordt verzameld, eindigt altijd op één plek — een bibliotheek van die kennis. Er zal geen winnaar zijn door uitkomst; er zullen alleen tijdelijke winnaars zijn door timing. Staten financieren nu al hun achterblijvers, en dit proces is onmogelijk te missen. Links naar verschillende nationale programma's staan aan het einde van deze notitie. Waar we mee eindigen. Elke maker betaalt opnieuw voor het recht om toegang te krijgen tot precies hetzelfde, bouwt opnieuw zijn eigen parsing-pijplijn voor dezelfde teksten, en komt opnieuw aan op precies dezelfde plek waar iedereen zal aankomen. Herhaalde kosten voor een enkel resultaat. Wat er in plaats daarvan nodig is. Een enkel wereldwijd corpus van kennis. Wettelijk beschermd. Gratis te gebruiken door iedereen. En gefinancierd door een internationaal fonds — niet eenmalig, maar doorlopend, omdat de vloed aan nieuwe kennis onophoudelijk binnenstroomt en het corpus onophoudelijk moet worden aangevuld. Is er enige zin in wereldwijde concurrentie op dit gebied, of is het al tijd om te kiezen voor samenwerking tussen naties? Miljarden en miljarden zouden worden bespaard en geïnvesteerd kunnen worden in concurrentie op het gebied van AI-adoptie. In welke vorm moet een wereldfonds van kennis worden gecreëerd? Niet gewichten zijn nodig, maar een geformaliseerde enkelvoudige bron van kennis, ondersteund door bronmateriaal. Gewichten worden binnen een jaar achterhaald, soms sneller; architecturen — binnen twee. Geformaliseerde kennis wordt niet achterhaald — het stapelt zich op. Formalization is nodig zodat kennis kan worden vergeleken, geverifieerd en in elke taal kan worden geleverd: taal wordt een projectie, geen opslagplaats. Bronmateriaal wordt altijd bewaard, omdat extractie nooit volledig zal zijn, en een geëxtraheerd feit is slechts een hypothese over wat er in de bron staat — en men moet het opnieuw kunnen controleren. Wat dit oplevert. In de evolutie van AI ten behoeve van de mensheid kunnen niet alleen zeer grote bedrijven met staatssteun deelnemen, maar ook kleine IT-bedrijven, individuele specialisten en landen die zelf geen grote modellen hebben. Het is daar, en niet aan de frontlinie, dat het grootste onbenutte voordeel ligt. Fork's zullen beschikbaar zijn voor velen en zullen het evolutionaire proces aandrijven. Concurrentie zal niet verdwijnen. Laat architecturen, technieken en trainingsmethoden concurreren. Maar niet de feiten zelf. De feiten van de mensheid behoren de mensheid toe. DNB Nationale steunprogramma's: een paar voorbeelden. Europese Unie, InvestAI (februari 2025) — een mobilisatie van 200 miljard euro, waarvan een nieuw Europees fonds van 20 miljard euro voor "AI-gigafabrieken", dat wil zeggen, voor de rekenkracht om de grootste modellen te trainen. https://oecd.ai/en/dashboards/policy-initiatives/investai China, Nationaal AI-industrie-investeringsfonds (april 2025) — 60 miljard yuan, ongeveer 8,2 miljard dollar. Oprichters — het Ministerie van Industrie en Informatietechnologie samen met het Ministerie van Financiën. Plus 11 nationale proefzones voor AI-innovatie. https://www.chinadaily.com.cn/a/202504/18/WS6802358ea3104d9fd38204b5.html India, IndiaAI Missie (goedgekeurd door de regering op 7 maart 2024) — meer dan 10.300 crore roepies voor vijf jaar, ongeveer 1,2 miljard dollar. Het ontwerp is veelzeggend: aparte posten gaan naar rekenkracht (meer dan 10.000 GPU's), een centrum voor het ontwikkelen van eigen funderingsmodellen — en het IndiaAI Datasets Platform, dat wil zeggen, een staatsprogramma om datasets te verzamelen en open te stellen. Precies waar deze notitie over gaat. https://www.pib.gov.in/PressReleasePage.aspx?PRID=2012375&reg=3&lang=2 Zuid-Korea, begroting 2026 — 10,1 biljoen won voor AI, ongeveer 7 miljard dollar: 2,6 biljoen voor adoptie in industrie en publieke diensten en 7,5 biljoen voor talent en infrastructuur. Aanschaf van nog eens 15.000 acceleratoren naar een totale vloot van 35.000, een aparte post voor eigen funderingsmodellen. https://www.korea.net/NewsFocus/policies/view?articleId=281702 Verenigd Koninkrijk, soevereine AI (juni 2026) — 1,1 miljard pond bovenop het in maart 2026 aangekondigde Sovereign AI-programma van 500 miljoen pond. Hiervan 750 miljoen voor een nationale AI-supercomputer in 2030 en 400 miljoen voor de aanschaf van acceleratoren. Het gestelde doel — een twintigvoudige toename van de rekenkracht van het land in 2030. https://www.computing.co.uk/news/2026/government/government-commits-more-than-one-billion-sovereign-ai Frankrijk (februari 2025) — 109 miljard euro aan aangekondigde private investeringen onder een staatsparaplu, plus publiek geld van France 2030, waaronder 360 miljoen euro voor het "IA Clusters"-programma. https://www.info.gouv.fr/actualite/ia-une-nouvelle-impulsion-pour-la-strategie-nationale Let op twee dingen. Ten eerste: bijna al het geld gaat naar rekenkracht en talent. Ten tweede: waar een land vanaf nul begint, is het eerste wat het creëert een staatsdatasetplatform — zoals India deed. Dus het probleem wordt al gezien. Maar tot nu toe lost elk land het op eigen houtje op. Hoewel, om eerlijk te zijn, velen de taak om kennis te verenigen nog niet eens zien of aanpakken, wat leidt tot onproductieve, nutteloze concurrentie.
Vers nieuws