Kazry: Fungsi Aktivasi Piecewise Baru untuk Jaringan Saraf Tiruan
Sebuah fungsi aktivasi jaringan saraf tiruan baru bernama Kazry diperkenalkan, yang mengungguli SiLU dalam pengujian, menawarkan propagasi sinyal yang lebih baik dan konvergensi yang lebih cepat. Kazry dan modifikasinya KazGLU menunjukkan nilai loss yang lebih baik pada CIFAR-100 baik dalam arsitektur CNN maupun Transformer, dengan hanya peningkatan waktu pelatihan yang sedikit dibandingkan dengan SiLU dan SwiGLU.
Sebuah artikel di Habr memperkenalkan Kazry, fungsi aktivasi piecewise baru untuk jaringan saraf. Penulis berpendapat bahwa aktivasi standar industri seperti SiLU, meskipun dapat diturunkan tak terhingga, memiliki turunan yang melemahkan sinyal, memperlambat konvergensi. Kazry mengatasi hal ini dengan menggunakan rumus piecewise dengan cabang negatif dan positif, meneruskan sinyal tanpa perubahan untuk input non-negatif. Pengujian pada CIFAR-100 dengan model CNN dan Transformer (yang terakhir menggunakan modifikasi GLU dan encoding posisi NoPE) menunjukkan bahwa Kazry mencapai loss pelatihan dan validasi yang lebih rendah dibandingkan SiLU, dan KazGLU mengungguli SwiGLU, dengan hanya peningkatan waktu pelatihan yang marginal. Artikel ini mencatat potensi kelemahan Kazry: diskontinuitas pada turunan kedua di nol, yang dapat memengaruhi optimizer yang lebih sensitif, dan kecepatan eksekusi yang sedikit lebih lambat karena percabangan logis dalam kode, meskipun secara matematis lebih sedikit operasi. Kode sumber dan log pelatihan tersedia di GitHub.
Sumber: Habr — хаб ИИ —
asli
