AMD、Instella-MoE-16B-A3Bをリリース:Instinct GPUでトレーニングされた2.8Bアクティブパラメータの完全オープンなMixture-of-Experts LLM
AMDは、完全オープンなMixture-of-Experts言語モデルInstella-MoE-16B-A3Bを発表しました。これは、総パラメータ数160億、トークンあたりのアクティブパラメータ数28億で、Instinct MI300XおよびMI325X GPU上でスクラッチからトレーニングされました。このリリースには、重み、データ混合、トレーニング設定、推論コードが含まれており、Gated Multi-head Latent AttentionやFarSkip-Collective接続などの革新的な機能を備えています。
AMDは、Instinct MI300XおよびMI325X GPU上でゼロから学習した、完全にオープンなMixture-of-Experts言語モデルであるInstella-MoE-16B-A3Bをリリースしました。このモデルは、合計160億のパラメータを持ちますが、トークンごとに活性化されるのはわずか28億で、各MoEレイヤーで64個のエキスパートから選択される6つのルーティングされたエキスパートと2つの共有エキスパートを使用しています。AMDは、各トレーニングステージの重みを、データ混合、トレーニング設定、推論コードとともに公開しています。重要な構造上の選択は2つあります。1つは、軽量な学習された出力ゲートを追加するGated Multi-head Latent Attention、もう1つは、エキスパート並列通信と計算をオーバーラップさせるFarSkip-Collectiveです。AMDは、事前学習で12.7%の高速化、エキスパート並列でサービスを提供する場合のファーストトークンまでの時間の最大39.2%の削減を報告しています。モデルは、オープンコーパスからの7.1兆トークンで事前学習され、中間学習ではDolma3 Dolmino 100Bを使用し、長期コンテキスト段階ではYaRNを使用してウィンドウを4Kから64Kに拡張しました。事後学習には、MilesフレームワークでのSFT(教師ありファインチューニング)、DPO(直接選好最適化)、RL(強化学習)が含まれます。ベースチェックポイントの平均は76.7で、完全にオープンなモデルの中で最も強力であり、Moonlight-16B-A3B(76.2)などを上回っています。重みは、学術および研究目的のみのResearchRAILライセンスの下にあり、トレーニングコードベースはMITライセンスです。
出典: MarkTechPost —
原文
