ForschungModelle 🇷🇺 06.08.2026 06:02

Kazry: Eine neue stückweise Aktivierungsfunktion für neuronale Netze

Eine neue Aktivierungsfunktion für neuronale Netze namens Kazry wurde vorgestellt, die in Tests SiLU übertraf und eine verbesserte Signalausbreitung sowie schnellere Konvergenz bietet. Kazry und seine Modifikation KazGLU zeigten bessere Verlustwerte auf CIFAR-100 in sowohl CNN- als auch Transformer-Architekturen, bei nur geringfügig höherer Trainingszeit im Vergleich zu SiLU und SwiGLU.
Ein Artikel auf Habr stellt Kazry vor, eine neue stückweise Aktivierungsfunktion für neuronale Netze. Der Autor argumentiert, dass branchenübliche Aktivierungen wie SiLU zwar unendlich differenzierbar sind, ihre Ableitung jedoch das Signal dämpft und die Konvergenz verlangsamt. Kazry begegnet diesem Problem mit einer stückweisen Formel mit negativen und positiven Zweigen, die das Signal für nicht-negative Eingaben unverändert durchlässt. Tests auf CIFAR-100 mit CNN- und Transformer-Modellen (letztere mit GLU-Modifikationen und NoPE-Positionskodierung) zeigten, dass Kazry im Vergleich zu SiLU einen niedrigeren Trainings- und Validierungsverlust erzielte, und KazGLU übertraf SwiGLU, bei nur marginal erhöhter Trainingszeit. Der Artikel weist auf mögliche Nachteile von Kazry hin: eine Diskontinuität in der zweiten Ableitung bei null, die empfindlichere Optimierer beeinträchtigen könnte, sowie eine geringfügig langsamere Ausführungsgeschwindigkeit aufgrund logischer Verzweigungen im Code, trotz mathematisch weniger Operationen. Quellcode und Trainingsprotokolle sind auf GitHub verfügbar.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten