Điểm chung giữa Tarot, Viterbi và các mô hình ngôn ngữ lớn: Một thuật toán chọn một nghĩa giữa muôn vàn nghĩa
Bài viết trình bày một mô hình giảng dạy diễn giải một chuỗi các lá bài Tarot như một quá trình tìm kiếm con đường ý nghĩa mạch lạc nhất, vẽ ra một phép tương tự với các thuật toán như Viterbi và beam search được sử dụng trong nhận dạng giọng nói, dịch máy và các mô hình ngôn ngữ. Mô hình coi mỗi lá bài như một hàm ánh xạ ngữ cảnh và ý nghĩa gốc vào một không gian diễn giải, sau đó tìm con đường tối ưu toàn cục. Nó so sánh lựa chọn tham lam, Viterbi, beam search và các phương pháp khác, đồng thời thảo luận về các mở rộng sử dụng factor graphs, CRF, nhúng ngữ nghĩa và xếp hạng lại bằng LLM.
Bài viết trên Habr khám phá cách việc giải nghĩa các lá bài Tarot có thể được mô hình hóa như việc lựa chọn con đường ý nghĩa nhất quán tối ưu nhất trong số nhiều phương án ứng viên, tương tự như các thuật toán Viterbi và beam search (tìm kiếm theo chùm). Tác giả bắt đầu từ ý tưởng rằng một lá bài đóng vai trò như một hàm ánh xạ từ ngữ cảnh và ý nghĩa vốn có của nó sang một tập hợp các cách giải nghĩa khả dĩ, nhưng lập luận rằng đơn vị tìm kiếm nên là toàn bộ con đường ngữ nghĩa, chứ không phải một cách giải nghĩa đơn lẻ. Một ví dụ cụ thể với năm trạng thái (Trì trệ, Suy ngẫm lại, Nguồn lực, Hành động, Chuyển tiếp) và ba lá bài (Người Bị Treo, Nhà Ảo Thuật, Xe Chiến) cho thấy cách tiếp cận vét cạn (greedy) chọn ra một con đường không tối ưu so với nghiệm tối ưu toàn cục của Viterbi. Mô hình hình thức ở đây là một chuỗi Markov có điều kiện không đồng nhất, trong đó phép giải mã Viterbi tìm ra con đường cực đại chính xác trong thời gian O(n*S^2). Tuy nhiên, khi điểm số phụ thuộc vào toàn bộ lịch sử hoặc văn bản tự do, cấu trúc con tối ưu (optimal substructure) sẽ bị mất, và beam search được sử dụng như một phương pháp xấp xỉ, trong đó diverse beam search (tìm kiếm theo chùm đa dạng) cũng được đề cập đến. Bài viết so sánh Viterbi, beam search, diverse beam, A* (A-star), MCTS (Monte Carlo Tree Search - Tìm kiếm cây Monte Carlo), và kỹ thuật xếp hạng lại bằng LLM (Large Language Model - Mô hình ngôn ngữ lớn), đồng thời đề cập đến factor graph (đồ thị nhân tố) và linear-chain CRF (Conditional Random Field - Trường ngẫu nhiên có điều kiện dạng chuỗi tuyến tính) như những công thức hóa mang tính tổng quát hơn. Bài viết cũng lưu ý rằng ý nghĩa thực tế có thể không khớp gọn vào các trạng thái rời rạc, do đó có thể sử dụng các vector embedding ngữ nghĩa (semantic embedding) và kỹ thuật xếp hạng lại bằng LLM, và gợi ý các hướng đi để biến minh họa này thành một nghiên cứu về việc ứng dụng AI hỗ trợ thực hành Tarot.
Nguồn: Habr — хаб NLP —
bản gốc
