Nghiên cứu 🇷🇺 01.08.2026 05:05

Ghi Nhớ Mọi Thứ: Phổ Trọng Số của Mạng Nơ-ron

PyTorchPyTorch
Bài viết chứng minh rằng thông tin về quá trình huấn luyện được lưu giữ trong phổ trọng số của mạng nơ-ron. Ngay cả sau khi lọc và lượng tử hóa, dữ liệu vẫn không bị xóa hoàn toàn, cho phép tinh chỉnh sử dụng các hệ số này làm điều kiện ban đầu. Ngoài ra, các hệ số phổ sau lượng tử hóa chiếm ít không gian hơn đáng kể, hữu ích cho việc thiết kế mạng nơ-ron.
Bài viết của một tác giả trên Habr khám phá các đặc tính phổ của trọng số mạng nơ-ron. Tác giả xây dựng một mạng nơ-ron đơn giản trên Colab (dịch vụ notebook Jupyter chạy trên nền tảng đám mây của Google) để phân loại hình chữ nhật và hình vuông, tạo ngẫu nhiên các hình chữ nhật với tọa độ 8 đỉnh làm đầu vào và nhãn nhị phân làm đầu ra. Mô hình gồm hai lớp tuyến tính (linear layer) với hàm kích hoạt ReLU (Rectified Linear Unit - đơn vị tuyến tính chỉnh lưu), được huấn luyện trong 10 epoch (chu kỳ huấn luyện) và đạt độ chính xác trên 99%. Sau khi huấn luyện, các trọng số được phân tích bằng phép biến đổi Fourier rời rạc DFT (Discrete Fourier Transform). Tác giả nhận thấy rằng sau khi áp dụng bộ lọc làm mượt (smoothing filter) và kỹ thuật lượng tử hóa mức màu (posterization) lên các hệ số phổ, thông tin thiết yếu về quá trình huấn luyện vẫn được giữ lại, và có thể sử dụng làm điều kiện khởi tạo cho việc tinh chỉnh (fine-tuning) sau này. Biểu diễn phổ đã được lượng tử hóa này chiếm dung lượng nhỏ hơn đáng kể so với trọng số gốc, mở ra một kỹ thuật nén tiềm năng. Tác giả cho rằng hiệu ứng này rất đáng chú ý đối với việc thiết kế mạng nơ-ron, đồng thời cung cấp mã nguồn dưới dạng các bản tóm tắt Markdown (md-summaries) để dùng làm prompt (câu lệnh chỉ dẫn) cho các tác nhân AI (AI agents).
Nguồn: Хабр — Data Mining — bản gốc
Bài viết liên quan trước đây ↓
Tin mới