Nghiên cứuMô hình 🇷🇺 27.07.2026 03:03

Mamba: Kiến trúc từng tìm cách thay thế Transformer

Moonshot AIMoonshot AI
Kiến trúc Mamba, dựa trên state space (SSM) có chọn lọc, được giới thiệu như một giải pháp thay thế cho transformer, hứa hẹn độ phức tạp tuyến tính thay vì bậc hai. Tuy nhiên, trong thực tế, Mamba đã không thay thế được transformer mà gia nhập vào các mô hình lai, nơi nó kết hợp với các lớp attention: cứ khoảng một lớp attention cho bảy lớp Mamba.
Vào tháng 12 năm 2023, các nhà nghiên cứu Albert Gu và Tri Dao đã giới thiệu kiến trúc Mamba, dựa trên các mô hình không gian trạng thái chọn lọc (Selective State Space Models - SSMs). Không giống như các bộ biến đổi (transformer), nơi mỗi token được so sánh với tất cả các token khác (độ phức tạp bậc hai O(N²)), Mamba sử dụng một trạng thái ẩn có kích thước cố định duy nhất được cập nhật tuần tự với độ phức tạp tuyến tính. Cải tiến chính là cơ chế chọn lọc: các tham số cập nhật trạng thái (A, B, C) được tính toán lại cho mỗi token, cho phép mô hình quyết định thông tin nào cần giữ lại và thông tin nào cần loại bỏ, tương tự như cơ chế chú ý (attention) nhưng không có chi phí bậc hai. Nhờ tính kết hợp của các phép tính, việc huấn luyện Mamba có thể được song song hóa, giải quyết vấn đề huấn luyện chậm vốn có của các mạng nơ-ron hồi quy (RNN) cũ. Tuy nhiên, Mamba có nhược điểm: trạng thái cố định nén thông tin, làm giảm khả năng trích xuất chi tiết và sao chép chính xác so với các bộ biến đổi, vốn lưu trữ tường minh tất cả các token. Do đó, Mamba chưa thay thế được các bộ biến đổi mà được sử dụng trong các mô hình lai, nơi khoảng một lớp chú ý được thêm vào cho mỗi bảy lớp Mamba. Sự kết hợp này giữ được bộ nhớ dài hạn chi phí thấp của Mamba và khả năng truy xuất chính xác của các bộ biến đổi. Kết quả là, nhiều mô hình hiện đại có thể sử dụng Mamba một cách ngầm định.
Nguồn: Habr — хаб NLP — bản gốc
Bài viết liên quan trước đây ↓
Tin mới