AI가 고대 잊혀진 언어를 다루다: 신경망이 할 수 있는 일
Google DeepMind
AI 신경망이 선형 문자 A, 에트루리아어, 인더스 계곡 문자와 같은 고대 문자의 해독을 돕고 있습니다. 이들은 누락된 텍스트 조각 복원, 패턴 발견, 가설 검증, 유물 연대 측정에 사용됩니다. 하지만 충분한 데이터나 맥락이 없으면 잃어버린 언어를 완전히 해독할 수는 없습니다.
고대 비문은 종종 사라진 문화를 대표하는 돌이나 점토 위의 신비한 기호로 이루어져 있습니다. 로제타석이나 관련 언어가 없으면 해독은 어렵습니다. 최근 신경망은 텍스트의 누락된 부분을 복원하고, 수천 개의 비문에서 패턴을 식별하며, 가설을 테스트하고, 연대와 기원을 추정하는 데 적용되었습니다. 신경망은 특히 반복되는 시퀀스를 찾고, 텍스트와 이미지를 모두 사용하여 공백을 메우는 데 뛰어납니다. 또한 관련 언어 간의 대응 관계를 검색하고, 가정을 대량으로 확인하며, 연대와 지리적 귀속을 제공할 수 있습니다. 예를 들어, Simon Cordwell은 Linear A에 대한 가설을 테스트하기 위해 프로그램을 사용하여 40개의 기호에 대한 판독과 408개의 단어 사전을 제안했습니다. Vesuvius Challenge 팀은 컴퓨터 단층 촬영과 신경망을 사용하여 탄화된 두루마리를 가상으로 펼쳐 철학적 논문을 드러냈습니다. Google DeepMind의 라틴어 비문용 Aeneas 모델은 공백 채우기에서 73%의 정확도를 달성하고, 지방 귀속에서 72%의 정확도를 보이며, 연대 추정에서 약 13년의 오차를 보입니다. 고대 그리스어용 Ithaca는 62%의 정확도로 텍스트를 복원하며, 역사가들이 사용할 때 그들의 정확도는 25%에서 72%로 향상되었습니다. 중국의 갑골 문자에 대해서는 생성적 적대 신경망이 잠재적인 누락 문자를 제안합니다. 그러나 신경망은 데이터에 없는 것을 추론할 수 없습니다. 텍스트가 너무 적으면 그럴듯하지만 검증되지 않은 가설만 제공할 수 있습니다. 그들은 가능성 있는 연속을 예측하지만 의미를 이해하지는 못합니다. 따라서 그들은 연구자들을 위한 도구로 남아 있으며, 가설 테스트와 발견 속도를 높이지만 잊혀진 언어를 스스로 완전히 해독할 수는 없습니다.
출처: Habr — хаб ИИ —
원문
