OnderzoekModellen 🇷🇺 06.08.2026 06:02

Kazry: een nieuwe stuksgewijze activatiefunctie voor neurale netwerken

Er is een nieuwe activatiefunctie voor neurale netwerken gepresenteerd, genaamd Kazry, die in tests beter presteerde dan SiLU en verbeterde signaalvoortplanting en snellere convergentie bood. Kazry en de modificatie KazGLU lieten betere verlieswaarden zien op CIFAR-100 in zowel CNN- als Transformer-architecturen, met slechts een lichte toename in trainingstijd vergeleken met SiLU en SwiGLU.
Een artikel op Habr introduceert Kazry, een nieuwe stuksgewijze activatiefunctie voor neurale netwerken. De auteur stelt dat industrie-standaard activatiefuncties zoals SiLU, hoewel oneindig differentieerbaar, een afgeleide hebben die het signaal dempt, waardoor de convergentie vertraagt. Kazry pakt dit aan door een stuksgewijze formule te gebruiken met negatieve en positieve takken, waarbij het signaal ongewijzigd wordt doorgegeven voor niet-negatieve inputs. Tests op CIFAR-100 met CNN- en Transformermodellen (de laatste met GLU-modificaties en NoPE-positiecodering) toonden aan dat Kazry een lagere trainings- en validatieloss behaalde in vergelijking met SiLU, en KazGLU presteerde beter dan SwiGLU, met slechts marginale toenames in trainingstijd. Het artikel vermeldt mogelijke nadelen van Kazry: een discontinuïteit in de tweede afgeleide bij nul, wat gevoeligere optimizers kan beïnvloeden, en een iets langzamere uitvoeringstijd door logische vertakkingen in de code, ondanks wiskundig minder operaties. Broncode en trainingslogs zijn beschikbaar op GitHub.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws