AI giải mã các ngôn ngữ cổ đã mất: Mạng nơ-ron có thể làm được gì
Google DeepMind
Mạng nơ-ron AI đang hỗ trợ việc giải mã các chữ viết cổ như Linear A, Etruscan và các ký hiệu Indus Valley. Chúng được sử dụng để khôi phục các mảnh văn bản bị thiếu, tìm kiếm các mẫu hình, kiểm tra các giả thuyết và xác định niên đại các hiện vật. Tuy nhiên, nếu không có đủ dữ liệu hoặc ngữ cảnh, chúng không thể giải mã hoàn toàn một ngôn ngữ đã mất.
Các bản khắc cổ thường bao gồm những ký hiệu bí ẩn trên đá hoặc đất sét, đại diện cho những nền văn hóa đã biến mất. Việc giải mã là một thách thức nếu không có Đá Rosetta hoặc các ngôn ngữ có liên quan. Gần đây, mạng nơ-ron đã được ứng dụng để khôi phục các phần bị thiếu của văn bản, xác định các mẫu lặp lại trong hàng nghìn bản khắc, kiểm tra giả thuyết và ước tính niên đại cùng nguồn gốc. Chúng đặc biệt giỏi trong việc tìm kiếm các chuỗi lặp lại và lấp đầy khoảng trống, sử dụng cả văn bản và hình ảnh. Chúng cũng có thể tìm kiếm sự tương ứng giữa các ngôn ngữ có liên quan, kiểm tra hàng loạt giả định và cung cấp niên đại cùng phân bố địa lý. Ví dụ, Simon Cordwell đã sử dụng một chương trình để kiểm tra giả thuyết về chữ viết Linear A, đề xuất cách đọc cho 40 ký hiệu và một từ điển gồm 408 từ. Nhóm Vesuvius Challenge đã sử dụng phương pháp chụp cắt lớp và mạng nơ-ron để gần như cuộn mở một cuộn giấy cói bị cacbon hóa, tiết lộ một luận thuyết triết học. Mô hình Aeneas của Google DeepMind cho các bản khắc Latinh đạt độ chính xác 73% trong việc lấp đầy khoảng trống, 72% trong phân bố tỉnh và sai số khoảng 13 năm trong xác định niên đại. Ithaca, dành cho tiếng Hy Lạp cổ, khôi phục văn bản với độ chính xác 62%, và khi được các nhà sử học sử dụng, độ chính xác của họ đã tăng từ 25% lên 72%. Đối với giáp cốt văn (xương bói toán) của Trung Quốc, mạng đối kháng tạo sinh (Generative Adversarial Networks) gợi ý các ký tự có thể bị thiếu. Tuy nhiên, mạng nơ-ron không thể suy ra những gì không có trong dữ liệu; nếu có quá ít văn bản, chúng chỉ có thể đưa ra các giả thuyết hợp lý nhưng chưa được kiểm chứng. Chúng dự đoán các phần tiếp theo có khả năng xảy ra nhưng không hiểu ý nghĩa. Do đó, chúng vẫn là công cụ cho các nhà nghiên cứu, tăng tốc quá trình kiểm tra giả thuyết và khám phá, nhưng không thể tự mình giải mã hoàn toàn một ngôn ngữ đã bị lãng quên.
Nguồn: Habr — хаб ИИ —
bản gốc
