RechercheModèles 🇷🇺 06.08.2026 06:02

Kazry : une nouvelle fonction d'activation par morceaux pour les réseaux de neurones

Une nouvelle fonction d'activation pour réseaux de neurones, nommée Kazry, a été présentée. Elle surpasse SiLU lors des tests, offrant une meilleure propagation du signal et une convergence plus rapide. Kazry et sa variante KazGLU ont montré de meilleures valeurs de perte sur CIFAR-100 dans les architectures CNN et Transformer, avec seulement une légère augmentation du temps d'entraînement par rapport à SiLU et SwiGLU.
Un article sur Habr présente Kazry, une nouvelle fonction d'activation par morceaux pour les réseaux de neurones. L'auteur soutient que les activations standard de l'industrie, comme SiLU, bien qu'infiniment différentiables, ont une dérivée qui atténue le signal, ralentissant ainsi la convergence. Kazry répond à ce problème en utilisant une formule par morceaux avec des branches négative et positive, transmettant le signal inchangé pour les entrées non négatives. Des tests sur CIFAR-100 avec des modèles CNN et Transformer (ce dernier utilisant des modifications GLU et un encodage de position NoPE) ont montré que Kazry atteignait une perte d'entraînement et de validation plus faible par rapport à SiLU, et que KazGLU surpassait SwiGLU, avec seulement des augmentations marginales du temps d'entraînement. L'article note des inconvénients potentiels de Kazry : une discontinuité dans la dérivée seconde à zéro, qui peut affecter les optimiseurs plus sensibles, et une vitesse d'exécution légèrement plus lente en raison de branchements logiques dans le code, malgré mathématiquement moins d'opérations. Le code source et les journaux d'entraînement sont disponibles sur GitHub.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches