研究モデル 🇷🇺 06.08.2026 06:02

Kazry: ニューラルネットワークのための新しい区分活性化関数

Kazryと呼ばれる新しいニューラルネットワーク活性化関数が発表され、テストでSiLUを上回り、信号伝播の改善と収束速度の向上を実現しました。Kazryとその改良版であるKazGLUは、CNNとTransformerの両方のアーキテクチャでCIFAR-100においてより良い損失値を示し、トレーニング時間はSiLUおよびSwiGLUと比較してわずかに増加しただけでした。
Habrの記事では、ニューラルネットワーク用の新しい区分的活性化関数であるKazryが紹介されています。著者は、業界標準の活性化関数であるSiLUは無限微分可能である一方、その導関数が信号を減衰させ、収束を遅くすると主張しています。Kazryは、負と正の分岐を持つ区分的な式を使用し、非負の入力に対して信号を変更せずに通過させることで、この問題に対処しています。CIFAR-100でのCNNとTransformerモデル(後者はGLU修正とNoPE位置エンコーディングを使用)を用いたテストでは、KazryはSiLUと比較してより低い訓練損失と検証損失を達成し、KazGLUはSwiGLUを上回りました。トレーニング時間の増加はわずかでした。記事では、Kazryの潜在的な欠点として、ゼロでの二次導関数の不連続性が挙げられており、これはより敏感なオプティマイザに影響を与える可能性があります。また、コード内の論理分岐のため、数学的にはより少ない演算であるにもかかわらず、実行速度がわずかに遅くなることが指摘されています。ソースコードとトレーニングログはGitHubで公開されています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース