主要なNLP面接質問: LLMアーキテクチャ、推論、最適化
Mistral
Google/DeepMind
この記事は、最新のLLMアーキテクチャと推論最適化に関する技術面接のための主要トピックと質問のチェックリストを提供します。バニラTransformerとのアーキテクチャ上の違い(Pre-Norm、RMSNorm、SwiGLU、RoPE、GQA/MQA、MoE)をカバーし、LLM推論が高コストな理由を説明し、バッチ処理、KVキャッシュ、量子化、その他の高速化技術について説明します。
現代の生成LLMは主にデコーダのみのトランスフォーマーであり、GPT、LLaMA、Mistral、Qwen、Gemmaなどのファミリーは、オープン性、パラメータ数(数億から数百億)、アーキテクチャの詳細(Dense対MoE)、アテンションの種類、正規化、位置エンコーディング、MLPの詳細、コンテキストウィンドウの長さ(例:4k、32k、128kトークン)、マルチモーダル対応、トレーニング、ライセンスが異なります。古典的なトランスフォーマーと比較して、現代のLLMは、Post-NormではなくPre-Normを使用し(トレーニングがより安定)、LayerNormではなくRMSNormを使用し(より低コスト)、SwiGLUゲート付きFFN(表現力が高いが、3番目の線形層を追加)、RoPE位置エンコーディング、完全なマルチヘッドアテンションではなくMQA/GQA、場合によっては条件付き計算のためのMoE(混合専門家)、より長いコンテキスト、推論の最適化を使用します。推論は高コストです。なぜなら、自己回帰生成はトークンごとにすべての重みを読み取り、KVキャッシュはコンテキストとバッチで増加し、プレフィル(計算バウンド)とデコード(メモリバウンド)の2つのフェーズがあるからです。レイテンシ(最初のトークンまでの時間、トークン間レイテンシ)とスループットのトレードオフが重要であり、最適化手法にはKVキャッシュ、ページド・アテンション、連続バッチング、投機的デコーディング、量子化、蒸留が含まれます。
出典: Habr — хаб ИИ —
原文
