Con đường mới cho khả năng diễn giải LLM: Phân rã trọng số với chi phí dữ liệu dưới 1%
OpenAI
Alibaba/Qwen
Các nhà nghiên cứu từ IQuest Research, Safe AI Forum, Oxford, Stanford và Tsinghua đề xuất Phân rã trọng số thưa (SWD), một phương pháp diễn giải các mô hình ngôn ngữ lớn bằng cách phân rã ma trận trọng số đã huấn luyện thành các yếu tố thưa, loại bỏ nhu cầu huấn luyện các mạng thay thế riêng. SWD sử dụng dưới 1% dữ liệu mà các phương pháp dựa trên huấn luyện như Transcoder cần, mở rộng lên mô hình 27B và cho phép trích xuất mạch và chỉnh sửa có mục tiêu trực tiếp từ trọng số.
IQuest Research Institute cùng với các cộng tác viên từ Safe AI Forum, Đại học Oxford, Đại học Stanford và Đại học Thanh Hoa đề xuất một phương pháp mới trong diễn giải cơ học cho các mô hình ngôn ngữ lớn, có tên là Phân rã Trọng số Thưa (SWD). Thay vì huấn luyện một mạng biểu diễn thưa riêng biệt để xấp xỉ các tầng của mô hình, SWD trực tiếp phân rã một ma trận trọng số dày đặc thành hai ma trận thưa A và B, trong đó các chiều trung gian được chia sẻ trở thành các đơn vị nút thắt cổ chai, có thể được chấm điểm, lựa chọn và cắt bỏ một cách độc lập. Điều này cho phép các nhà nghiên cứu trích xuất trực tiếp các mạch tác vụ từ các trọng số. Trong các thí nghiệm đơn ma trận khớp với độ trung thực thay thế, SWD sử dụng ít hơn 1% dữ liệu so với các phương pháp cơ sở dựa trên huấn luyện như Transcoder. Trên GPT-2, Qwen2.5 và Qwen3.5-27B, SWD thường đạt được các mục tiêu về tính đầy đủ và cần thiết với ít đơn vị nút thắt cổ chai và kết nối hoạt động hơn. Phương pháp này mở rộng quy mô lên các mô hình 27B và bao phủ tất cả 48 ma trận trọng số attention và MLP của GPT-2 Small, với phiên bản không dữ liệu yêu cầu không cần văn bản hiệu chuẩn. Bài báo báo cáo rằng trong GPT-2 Small, SWD đạt được CE delta thấp chỉ với vài nghìn token hiệu chuẩn, trong khi các phương pháp cơ sở dựa trên huấn luyện cần khoảng 10^6 token. Việc thay thế toàn bộ mô hình trên GPT-2 Small, sử dụng SWD-FT, giảm CE từ 3,90 xuống 3,44 với cùng số kết nối, sử dụng khoảng 20,6 triệu token so với 2,884 tỷ token cho một phương pháp cơ sở tiền huấn luyện thưa. Phân tích ngữ nghĩa của các đơn vị nút thắt cổ chai có thứ hạng cao trong tác vụ GreaterThan cho thấy bốn trong sáu đơn vị phản hồi với số, năm, số lượng hoặc đơn vị đo lường. Một thí nghiệm chỉnh sửa có mục tiêu trên một đơn vị (c205) đã tăng biên độ logit cho câu trả lời đúng lên 0,216 với ít tác dụng phụ, chứng minh rằng các hướng có nguồn gốc từ SWD có thể được sử dụng để kiểm soát hành vi một cách chính xác.
Nguồn: QbitAI 量子位 —
bản gốc
