⚡ 速報
モデル研究 🇺🇸 27.07.2026 18:03

GPT-2からgpt-ossへ:アーキテクチャの進歩とQwen3との比較分析

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAIは、GPT-2以来初のオープンウェイトモデルとなるgpt-oss-120bとgpt-oss-20bをリリースしました。アーキテクチャは、Mixture-of-Experts(混合エキスパート)、Grouped Query Attention(グループ化クエリアテンション)、RoPE、SwiGLU、およびローカル推論向けのMXFP4最適化を特徴としています。GPT-2やQwen3との比較では、幅と深さのトレードオフや注意シンクに関する進展が強調されています。
OpenAIは、2019年のGPT-2以来となる初のオープンウェイトLLM「gpt-oss-120b」と「gpt-oss-20b」を公開しました。これらのモデルはGPT-2に比べていくつかのアーキテクチャ上の改善を取り入れています。具体的には、ドロップアウトの除去、絶対位置埋め込みからRoPE(Rotary Position Embedding)への置き換え、活性化関数をGELUからSwiGLU(Swish-Gated Linear Unit)に変更、Mixture-of-Experts(MoE)の追加、Grouped Query Attention(GQA)の採用などです。MoEにより総パラメータ数は増加しますが、トークンごとにサブセットのみが活性化されるため、推論効率が維持されます。GQAはキー・バリューヘッド数を削減し、メモリ使用量を低減します。また、モデルはMXFP4最適化を採用し、20Bモデルは16GBのコンシューマーGPU、120BモデルはH100 80GBに収まるように設計されています。Qwen3と比較して、gpt-ossは幅と深さのトレードオフを探求しています。アテンションバイアスやシンクについても議論されています。記事ではGPT-5についても簡単に触れています。ベンチマークでは競争力のあるパフォーマンスを示していますが、詳細なスコアは提供されていません。
出典: Sebastian Raschka — 原文
関連記事 ↓
新着ニュース