Nghiên cứuMô hình 🇷🇺 06.08.2026 06:02

Kazry: Hàm kích hoạt từng phần mới cho mạng nơ-ron

Một hàm kích hoạt mạng nơ-ron mới có tên Kazry đã được giới thiệu, vượt trội hơn SiLU trong các thử nghiệm, mang lại khả năng truyền tín hiệu được cải thiện và hội tụ nhanh hơn. Kazry và biến thể KazGLU của nó cho thấy giá trị mất mát tốt hơn trên CIFAR-100 trong cả kiến trúc CNN và Transformer, chỉ với việc tăng nhẹ thời gian huấn luyện so với SiLU và SwiGLU.
Một bài viết trên Habr giới thiệu Kazry, một hàm kích hoạt (activation function) dạng phân đoạn (piecewise) mới dành cho mạng nơ-ron. Tác giả cho rằng các hàm kích hoạt tiêu chuẩn của ngành như SiLU, dù có thể vi phân vô hạn lần (infinitely differentiable), lại có đạo hàm làm suy giảm tín hiệu, khiến quá trình hội tụ (convergence) diễn ra chậm hơn. Kazry giải quyết vấn đề này bằng một công thức phân đoạn gồm hai nhánh âm và dương, cho phép tín hiệu đi qua không đổi đối với các giá trị đầu vào không âm. Các bài kiểm tra trên tập dữ liệu CIFAR-100 với các mô hình CNN (Convolutional Neural Network - mạng nơ-ron tích chập) và Transformer (trong đó Transformer sử dụng các biến thể GLU và phương pháp mã hóa vị trí NoPE) cho thấy Kazry đạt được giá trị hàm mất (loss) thấp hơn ở cả giai đoạn huấn luyện (training) và kiểm định (validation) so với SiLU, đồng thời KazGLU vượt trội hơn SwiGLU, trong khi thời gian huấn luyện chỉ tăng lên không đáng kể. Bài viết cũng chỉ ra một số hạn chế tiềm ẩn của Kazry: sự không liên tục của đạo hàm bậc hai tại điểm không, điều này có thể ảnh hưởng đến các bộ tối ưu hóa (optimizer) nhạy cảm hơn, cùng với tốc độ thực thi chậm hơn một chút do việc phân nhánh logic trong mã nguồn, mặc dù về mặt toán học số lượng phép tính lại ít hơn. Mã nguồn và nhật ký huấn luyện (training logs) hiện đã được công khai trên GitHub.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới