Kazry: 신경망을 위한 새로운 조각별 활성화 함수
Kazry라고 하는 새로운 신경망 활성화 함수가 발표되었으며, 테스트에서 SiLU보다 우수한 성능을 보여 신호 전파를 개선하고 수렴 속도를 높였습니다. Kazry와 그 변형인 KazGLU는 CNN 및 Transformer 아키텍처 모두에서 CIFAR-100에 대해 더 나은 손실 값을 나타냈으며, SiLU 및 SwiGLU에 비해 훈련 시간이 약간만 증가했습니다.
Habr에 게재된 기사는 신경망용 새로운 조각별 활성화 함수인 Kazry를 소개합니다. 저자는 SiLU와 같은 업계 표준 활성화 함수가 무한히 미분 가능하지만, 그 도함수가 신호를 약화시켜 수렴 속도를 늦춘다고 주장합니다. Kazry는 음수와 양수 가지를 가진 조각별 공식을 사용하여 이 문제를 해결하며, 음수가 아닌 입력에 대해서는 신호를 변경하지 않고 전달합니다. CIFAR-100을 사용한 CNN 및 Transformer 모델(후자는 GLU 변형과 NoPE 위치 인코딩 사용)에 대한 테스트에서 Kazry는 SiLU에 비해 더 낮은 훈련 및 검증 손실을 달성했으며, KazGLU는 SwiGLU보다 우수한 성능을 보였고 훈련 시간은 약간만 증가했습니다. 기사에서는 Kazry의 잠재적인 단점으로 0에서 2차 도함수의 불연속성(이는 더 민감한 옵티마이저에 영향을 줄 수 있음)과 수학적으로는 연산 수가 적음에도 불구하고 코드의 논리적 분기로 인해 실행 속도가 약간 느리다는 점을 언급합니다. 소스 코드와 훈련 로그는 GitHub에서 확인할 수 있습니다.
출처: Habr — хаб ИИ —
원문
