研究モデル 🇷🇺 01.08.2026 20:01

離散量子化:ニューラルネットワーク圧縮の次のフロンティア

PrismMLPrismML
この記事では、古典的な量子化手法から離散量子化への移行について探求します。離散量子化では、重みが少数の値(バイナリ、ターナリ)に制限されます。PrismMLのBonsai 27Bモデルファミリーを強調し、Qwen 3.6 27Bのバイナリ版とターナリ版を使用して、最大14倍の圧縮を達成しながらも元のモデルの能力のかなりの部分を保持しています。著者はターナリ版をテストし、推論速度の向上を確認しましたが、複雑なタスクでは性能低下が不均一であることを指摘し、コンシューマ向けハードウェアで大規模モデルを実行する実用的な影響について議論しています。
この記事はまず、ニューラルネットワーク量子化の進化について議論し、従来の浮動小数点形式からINT8やINT4などの整数型へ、さらにバイナリ(1ビット)やターナリ(1.58ビット)の重みを持つ離散量子化へと移行する様子を扱っています。このアプローチにより、モデルのサイズが大幅に削減され、コンシューマー向けハードウェアでの展開が可能になります。PrismMLのBonsai 27Bファミリーは、Qwen 3.6 27Bをベースにしており、バイナリ版とターナリ版を提供しており、それぞれ3.8GBと7.17GBで、元の53.8GBと比較して大幅に小さくなっています。同社は元の能力の最大90〜95%の保持を主張していますが、著者のテストでは数学とコーディングで約75%、複雑なマルチエージェント関数呼び出しで60%となっており、それでも10分の1のサイズのモデルとしては印象的です。著者は、ターナリモデルが元のモデルよりも速度で優れており、テキスト生成が速いことを指摘しています。さらに、投機的ドラフターのDSparkが含まれており、品質を損なうことなく生成速度を35%向上させます。ただし、このモデルは標準外の量子化形式のため、llama.cppの特別なフォークが必要であり、著者はそのビルドと実行方法を示しています。著者は、これは大きな成果であり、より大きな量子化モデルと同等の品質を提供しつつ、より少ないVRAMに収まるため、ローカル展開や、場合によってはiPhone 17 Pro Maxのようなモバイルデバイスでの利用に適していると結論付けています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース