Comparaison des architectures de grands modèles de langage : de DeepSeek V3 à OLMo 2
Sebastian Raschka a publié une comparaison détaillée des architectures des LLM ouverts modernes, mettant en lumière les innovations clés : l'attention latente multi-têtes (MLA) et le mélange d'experts (MoE) dans DeepSeek V3, ainsi que les caractéristiques de normalisation dans OLMo 2. L'article couvre l'évolution de GPT-2 aux modèles de 2025.
DeepSeek
Allen Institute for AI











