Nghiên cứu 🇺🇸 27.07.2026 15:06

SPEX và ProxySPEX: Phương pháp xác định tương tác ảnh hưởng trong LLM ở quy mô lớn

OpenAIOpenAI
Các nhà nghiên cứu từ BAIR (Berkeley AI) đã giới thiệu SPEX và ProxySPEX — các thuật toán có khả năng xác định các tương tác quan trọng giữa các đặc trưng, dữ liệu và thành phần của mô hình AI, bao gồm các mô hình ngôn ngữ lớn (LLM), nhanh hơn các phương pháp hiện có nhiều bậc độ lớn. Các phương pháp dựa trên ý tưởng tính thưa thớt của các tương tác có ảnh hưởng và sử dụng các kỹ thuật từ lý thuyết mã hóa và xử lý tín hiệu. Ứng dụng của SPEX cho thấy các phương pháp quy gán tiêu chuẩn (ví dụ SHAP) có thể bỏ qua các hiệp đồng phức tạp, như trong trường hợp bài toán xe điện (trolley problem). ProxySPEX, khai thác tính chất phân cấp, đạt được độ chính xác tương đương với khoảng 10 lần ít phép loại bỏ.
Các nhà nghiên cứu từ BAIR (Phòng thí nghiệm Nghiên cứu Trí tuệ Nhân tạo Berkeley) đã phát triển các thuật toán SPEX và ProxySPEX để xác định các tương tác có ảnh hưởng giữa các thành phần của hệ thống máy học phức tạp, bao gồm các mô hình ngôn ngữ lớn (LLM). Thách thức là số lượng tương tác tiềm năng tăng theo hàm mũ với số lượng đặc trưng, điểm dữ liệu hoặc thành phần nội bộ, khiến việc liệt kê toàn bộ trở nên bất khả thi về mặt tính toán. SPEX tận dụng các giả định về tính thưa và bậc thấp: số lượng tương tác thực sự có ảnh hưởng là nhỏ và chúng chỉ liên quan đến một tập hợp con nhỏ các phần tử. Bằng cách sử dụng các phép loại bỏ (ablation) được chọn lọc chiến lược và các thuật toán khôi phục thưa từ lý thuyết mã hóa, SPEX xác định hiệu quả các tương tác này. ProxySPEX khai thác thêm tính phân cấp: nếu một tương tác bậc cao là quan trọng, thì các tập con bậc thấp hơn của nó cũng quan trọng, giảm số lượng phép loại bỏ khoảng mười lần so với SPEX. Trong các tác vụ quy kết đặc trưng (feature attribution), SPEX vượt trội hơn các phương pháp hiện có trên các ngữ cảnh dài (hàng nghìn đặc trưng). Ví dụ, trong một 'bài toán xe điện' (trolley problem) đã được sửa đổi, phương pháp SHAP tiêu chuẩn quy kết câu trả lời sai của GPT-4o mini cho các từ riêng lẻ như 'trolley,' trong khi SPEX xác định sự hiệp đồng (synergy) giữa hai lần xuất hiện của 'trolley' với 'pulling' và 'lever'; thay thế bốn từ này bằng từ đồng nghĩa đã giảm tỷ lệ lỗi của mô hình xuống gần bằng không. Trong quy kết dữ liệu (data attribution), ProxySPEX đã thành công trong việc làm nổi bật các tương tác hiệp đồng và dư thừa (redundant) giữa các mẫu huấn luyện cho ResNet trên CIFAR-10. Trong khả năng giải thích cơ học (mechanistic interpretability) (quy kết thành phần), phương pháp này đã tiết lộ cách các đầu chú ý (attention heads) trong các lớp LLM khác nhau tương tác và cải thiện hiệu suất mô hình mục tiêu sau khi cắt tỉa (pruning) so với các phương pháp khác. Mã nguồn cho SPEX và ProxySPEX có sẵn trong kho lưu trữ SHAP-IQ.
Nguồn: BAIR (Berkeley AI) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới