Kazry: una nueva función de activación por tramos para redes neuronales
Se presentó una nueva función de activación para redes neuronales llamada Kazry, que superó a SiLU en las pruebas, ofreciendo una mejor propagación de la señal y una convergencia más rápida. Kazry y su modificación KazGLU mostraron mejores valores de pérdida en CIFAR-100 tanto en arquitecturas CNN como Transformer, con solo un ligero aumento en el tiempo de entrenamiento en comparación con SiLU y SwiGLU.
Un artículo en Habr presenta Kazry, una nueva función de activación por tramos para redes neuronales. El autor argumenta que las activaciones estándar de la industria, como SiLU, aunque son infinitamente diferenciables, tienen una derivada que amortigua la señal, ralentizando la convergencia. Kazry aborda este problema utilizando una fórmula por tramos con ramas negativa y positiva, transmitiendo la señal sin cambios para entradas no negativas. Las pruebas en CIFAR-100 con modelos CNN y Transformer (este último utilizando modificaciones GLU y codificación posicional NoPE) mostraron que Kazry logró una pérdida de entrenamiento y validación menor en comparación con SiLU, y KazGLU superó a SwiGLU, con solo aumentos marginales en el tiempo de entrenamiento. El artículo señala posibles desventajas de Kazry: una discontinuidad en la segunda derivada en cero, que puede afectar a optimizadores más sensibles, y una velocidad de ejecución ligeramente más lenta debido a la ramificación lógica en el código, a pesar de tener matemáticamente menos operaciones. El código fuente y los registros de entrenamiento están disponibles en GitHub.
Fuente: Habr — хаб ИИ —
original
