AI攻克远古失落语言:神经网络能做些什么
Google DeepMind
AI神经网络正协助解读诸如线性文字A、伊特鲁里亚语和印度河谷符号等古代文字。它们被用于修复缺失的文本片段、发现模式、检验假设以及为文物断代。然而,在缺乏足够数据或上下文的情况下,它们无法完全破解一门失传的语言。
古老的铭文常常由石头或泥板上的神秘符号构成,代表了已经消失的文化。在没有罗塞塔石碑或相关语言的情况下,破译这些铭文颇具挑战。近年来,神经网络已被应用于修复文本的缺失部分、识别数千条铭文中的模式、检验假设以及估算年代和起源。它们特别擅长发现重复序列和填补空缺,同时利用文本和图像信息。它们还能搜索相关语言之间的对应关系,进行大规模假设检验,并提供年代和地理归属的推测。例如,西蒙·科德韦尔使用一个程序来检验关于线形文字A的假设,提出了40个符号的解读和一部包含408个词的词典。维苏威挑战赛团队利用断层扫描和神经网络,将一张碳化卷轴虚拟展开,揭示了一篇哲学论著。谷歌深度思维公司针对拉丁铭文的伊尼亚斯模型在填补空缺方面准确率达到73%,省份归属准确率为72%,年代判定的误差约为13年。针对古希腊文的伊萨卡模型,其文本修复准确率为62%,而当历史学家使用它时,他们的准确率从25%提升到了72%。对于中国甲骨文,生成对抗网络能够提出可能的缺失字符。然而,神经网络无法推断出数据之外的信息;如果现有文本过少,它们只能提供看似合理但未经证实的假设。它们能预测可能的续文,但并不理解其含义。因此,它们仍然是研究者的工具,可以加速假设检验和发现,但无法完全独立地破译一种被遗忘的语言。
来源: Habr — хаб ИИ —
原文
