пропуская сигнал без изменений для неотрицательных входных значений. Тесты на CIFAR-100 с моделями CNN и Transformer (последние используют модификации GLU и позиционное кодирование NoPE) показали, что Kazry достигает более низких значений функции потерь на обучающей и валидационной выборках по сравнению с SiLU, а KazGLU превосходит SwiGLU, при этом время обучения увеличивается незначительно. В статье отмечаются потенциальные недостатки Kazry: разрыв второй производной в нуле, что может повлиять на более чувствительные оптимизаторы, и немного меньшая скорость выполнения из-за логического ветвления в коде, несмотря на меньшее количество математических операций. Исходный код и журналы обучения доступны на GitHub.