Kazry: Uusi paloittainen aktivointifunktio neuroverkoille
Esiteltiin uusi neuroverkkojen aktivointifunktio nimeltä Kazry, joka suoriutui testeissä SiLU:ta paremmin tarjoten parannetun signaalin etenemisen ja nopeamman konvergenssin. Kazry ja sen muunnelma KazGLU osoittivat parempia häviöarvoja CIFAR-100:ssa sekä CNN- että Transformer-arkkitehtuureissa, vain hieman pidemmällä harjoitusajalla verrattuna SiLU:hun ja SwiGLU:hun.
Habrissa julkaistussa artikkelissa esitellään Kazry, uusi paloittain määritelty aktivointifunktio neuroverkoille. Kirjoittaja perustelee, että teollisuuden vakioaktivoinnit, kuten SiLU, ovat toki äärettömän monta kertaa derivoituvia, mutta niiden derivaatta vaimentaa signaalia, mikä hidastaa konvergenssia. Kazry ratkaisee ongelman käyttämällä paloittain määriteltyä kaavaa, jossa on negatiivinen ja positiivinen haara, ja välittää signaalin muuttumattomana ei-negatiivisille syötteille. CIFAR-100-testit CNN- ja Transformer-malleilla (joissa käytettiin GLU-muunnelmia ja NoPE-positiointia) osoittivat, että Kazry saavutti SiLUa pienemmän harjoitus- ja validaatiohäviön, ja KazGLU päihitti SwiGLU:n vain marginaalisella harjoitusajan kasvulla. Artikkelissa huomautetaan Kazryn mahdollisista haitoista: nollakohdassa on toisen derivaatan epäjatkuvuus, joka voi vaikuttaa herkempiin optimoijiin, sekä hieman hitaampi suoritusnopeus koodin loogisesta haarautumisesta johtuen, vaikka matemaattisesti operaatiot ovat vähäisemmät. Lähdekoodi ja harjoituslokit ovat saatavilla GitHubissa.
Lähde: Habr — хаб ИИ —
Alkuperäinen
