PesquisaModelos 🇷🇺 06.08.2026 06:02

Kazry: Uma Nova Função de Ativação por Partes para Redes Neurais

Uma nova função de ativação para redes neurais chamada Kazry foi apresentada, superando a SiLU em testes, oferecendo melhor propagação de sinal e convergência mais rápida. Kazry e sua modificação KazGLU mostraram melhores valores de perda no CIFAR-100 em arquiteturas tanto de CNN quanto de Transformer, com apenas um leve aumento no tempo de treinamento em comparação com SiLU e SwiGLU.
Um artigo no Habr apresenta o Kazry, uma nova função de ativação por partes para redes neurais. O autor argumenta que ativações padrão da indústria, como SiLU, embora infinitamente diferenciáveis, têm uma derivada que atenua o sinal, desacelerando a convergência. O Kazry aborda isso usando uma fórmula por partes com ramos negativos e positivos, passando o sinal inalterado para entradas não negativas. Testes no CIFAR-100 com modelos CNN e Transformer (este usando modificações GLU e codificação posicional NoPE) mostraram que o Kazry alcançou menor perda de treinamento e validação em comparação com SiLU, e o KazGLU superou o SwiGLU, com apenas aumentos marginais no tempo de treinamento. O artigo observa possíveis desvantagens do Kazry: uma descontinuidade na segunda derivada em zero, que pode afetar otimizadores mais sensíveis, e velocidade de execução ligeiramente mais lenta devido à ramificação lógica no código, apesar de ter menos operações matematicamente. O código-fonte e os registros de treinamento estão disponíveis no GitHub.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas