단일 개방형 세계 지식 말뭉치
최고의 모델을 훈련하기 위한 경쟁에는 한계가 있습니다. 모두가 동일한 인류 지식의 창고에 도달하기 때문입니다. 각 제작자가 동일한 데이터에 대해 새로운 비용을 지불하는 대신, 우리는 영구적인 국제 기금으로 지원되는 단일하고 법적으로 보호되며 자유롭게 사용할 수 있는 세계 지식 코퍼스(corpus)가 필요합니다.
모델들의 최고 훈련을 위한 경쟁에는 한계가 있습니다. 점차 모든 제조사는 최대한 정보를 갖춘 모델에 필요한 전체 데이터 세트를 갖추게 될 것입니다. 모든 인류 지식을 수집하는 길은 항상 한 곳, 즉 그 지식의 도서관에서 끝납니다. 결과에 의한 승자는 없을 것이며, 시점에 의한 임시 승자만 있을 것입니다.
국가들은 이미 뒤처진 자들에게 자금을 지원하고 있으며, 이 과정을 눈치채지 못하기 어렵습니다. 여러 국가 프로그램에 대한 링크가 이 메모 말미에 있습니다.
결국 우리가 얻게 되는 것은. 모든 제조사는 동일한 것에 접근할 권리를 위해 새로이 비용을 지불하고, 동일한 텍스트를 위해 자체 파싱 파이프라인을 새로 구축하며, 모두가 도달할 바로 그 장소에 새로이 도달합니다. 단일 결과를 위한 반복 비용입니다.
대신 필요한 것. 단일 세계 지식 코퍼스(corpus)입니다. 법적으로 보호되고, 누구나 무료로 사용할 수 있으며, 국제 기금에 의해 일회성이 아닌 지속적으로 자금을 지원받아야 합니다. 새로운 지식의 홍수는 멈추지 않고 쏟아지며 코퍼스는 끊임없이 보충되어야 하기 때문입니다.
이 분야에서 세계적 경쟁이 의미가 있을까요, 아니면 이미 국가 간 협력을 선택할 때일까요? 수십억 달러가 절약되어 인공지능 도입 분야의 경쟁에 투자될 수 있습니다.
세계 지식 기금은 어떤 형태로 만들어져야 할까?
필요한 것은 가중치가 아니라 원천 자료에 기반한 공식화된 단일 지식 소스입니다. 가중치는 1년 이내, 때로는 더 빨리 구식이 되고, 아키텍처는 2년 이내에 구식이 됩니다. 공식화된 지식은 구식이 되지 않고 축적됩니다. 지식을 비교, 검증하고 어떤 언어로도 전달할 수 있도록 공식화가 필요합니다. 언어는 저장소가 아닌 투영(projection)이 됩니다. 원천 자료는 항상 보존되어야 합니다. 추출이 완전할 수 없고, 추출된 사실은 원천에 쓰여진 것에 대한 가설일 뿐이므로 다시 확인할 수 있어야 하기 때문입니다.
이것이 주는 것. 인류를 위한 인공지능 진화에 초대형 기업뿐만 아니라 소규모 IT 기업, 개인 전문가, 자체 대형 모델이 없는 국가들도 참여할 수 있게 됩니다. 바로 거기, 최전선이 아니라, 주요 미활용 이점이 있습니다. 포크(forks)는 많은 이들이 사용할 수 있게 되어 진화 과정을 촉진할 것입니다.
경쟁은 사라지지 않을 것입니다. 아키텍처, 기술 및 훈련 방법이 경쟁하게 하십시오. 그러나 사실 자체는 경쟁하지 않아야 합니다. 인류의 사실은 인류의 것입니다.
DNB
국가 지원 프로그램: 몇 가지 예.
유럽 연합, InvestAI (2025년 2월) — 2,000억 유로 동원, 그중 200억 유로는 'AI 기가팩토리', 즉 대형 모델 훈련을 위한 컴퓨팅 용량을 위한 새로운 유럽 기금.
https://oecd.ai/en/dashboards/policy-initiatives/investai
중국, 국가 AI 산업 투자 기금 (2025년 4월) — 600억 위안, 약 82억 달러. 설립자는 산업정보기술부와 재정부. 또한 11개의 국가 AI 혁신 시범 구역.
https://www.chinadaily.com.cn/a/202504/18/WS6802358ea3104d9fd38204b5.html
인도, IndiaAI 미션 (2024년 3월 7일 정부 승인) — 5년간 10,300 crore 루피 이상, 약 12억 달러. 그 설계가 시사하는 바가 큽니다: 별도 항목으로 컴퓨팅(10,000개 이상의 GPU), 자체 기반 모델 개발 센터, 그리고 IndiaAI 데이터세트 플랫폼, 즉 데이터 수집 및 공개를 위한 국가 프로그램. 바로 이 메모가 다루는 내용입니다.
https://www.pib.gov.in/PressReleasePage.aspx?PRID=2012375®=3&lang=2
대한민국, 2026년 예산 — AI에 10조 1천억 원, 약 70억 달러: 2조 6천억 원은 산업 및 공공 서비스 도입, 7조 5천억 원은 인재 및 인프라. 추가로 15,000개의 가속기 조달, 총 35,000대 목표, 자체 기반 모델을 위한 별도 항목.
https://www.korea.net/NewsFocus/policies/view?articleId=281702
영국, 주권 AI (2026년 6월) — 2026년 3월 발표된 5억 파운드 주권 AI 프로그램에 추가로 11억 파운드. 이 중 7억 5천만 파운드는 2030년까지 국가 AI 슈퍼컴퓨터, 4억 파운드는 가속기 조달. 명시된 목표는 2030년까지 국가 컴퓨팅 용량 20배 증가.
https://www.computing.co.uk/news/2026/government/government-commits-more-than-one-billion-sovereign-ai
프랑스 (2025년 2월) — 국가 지원 아래 발표된 1,090억 유로의 민간 투자, France 2030의 공공 자금 포함, 그중 3억 6천만 유로는 'IA 클러스터' 프로그램.
https://www.info.gouv.fr/actualite/ia-une-nouvelle-impulsion-pour-la-strategie-nationale
두 가지를 주목하십시오.
첫째: 거의 모든 자금이 컴퓨팅과 인재에 들어갑니다.
둘째: 국가가 처음부터 시작하는 경우, 가장 먼저 만드는 것은 인도처럼 국가 데이터세트 플랫폼입니다. 따라서 문제는 이미 인식되고 있습니다. 그러나 지금까지 각국은 자체적으로 해결하고 있습니다. 솔직히 말하면, 많은 국가들이 아직 지식 통합 과제를 보거나 다루지 않아 비생산적이고 쓸모없는 경쟁을 허용하고 있습니다.
