Meilleures Questions d'Entretien NLP : Architectures LLM, Inférence et Optimisation
Mistral
Google/DeepMind
Cet article propose une liste de contrôle des sujets et questions clés pour les entretiens techniques sur les architectures LLM modernes et l'optimisation de l'inférence. Il couvre les différences architecturales par rapport au Transformer vanille (Pré-Normalisation, RMSNorm, SwiGLU, RoPE, GQA/MQA, MoE), explique pourquoi l'inférence des LLM est coûteuse, et décrit le batching, le cache KV, la quantification, et d'autres techniques d'accélération.
Les LLM génératifs modernes sont principalement des transformeurs à décodeur seul, avec des familles comme GPT, LLaMA, Mistral, Qwen et Gemma qui diffèrent en termes d'ouverture, de nombre de paramètres (de centaines de millions à des centaines de milliards), de détails d'architecture (dense vs MoE), de type d'attention, de normalisation, d'encodage positionnel, de spécificités du MLP, de longueur de fenêtre de contexte (par exemple, 4 000, 32 000, 128 000 jetons), de support multimodal, d'entraînement et de licence. Par rapport au transformeur classique, les LLM modernes utilisent la pré-normalisation au lieu de la post-normalisation (entraînement plus stable), RMSNorm au lieu de LayerNorm (moins coûteux), une FFN à porte SwiGLU (plus expressive mais ajoute une troisième couche linéaire), des plongements positionnels RoPE, MQA/GQA au lieu d'une attention multi-têtes complète, parfois MoE (mélange d'experts) pour un calcul conditionnel, un contexte plus long et des optimisations d'inférence. L'inférence est coûteuse car la génération autorégressive lit tous les poids à chaque jeton, le cache KV croît avec le contexte et la taille du lot, et il y a deux phases : le préremplissage (lié au calcul) et le décodage (lié à la mémoire). Les compromis entre latence (temps jusqu'au premier jeton, latence inter-jetons) et débit sont essentiels ; les techniques d'optimisation incluent le cache KV, l'attention paginée, le traitement par lots continu, le décodage spéculatif, la quantification et la distillation.
Source: Habr — хаб ИИ —
original
