InvestigaciónHardware e Inferencia 🇷🇺 10.08.2026 23:02

Principales preguntas de entrevista sobre PLN: arquitecturas de LLM, inferencia y optimización

MistralMistral Google/DeepMindGoogle/DeepMind
Este artículo ofrece una lista de verificación de temas y preguntas clave para entrevistas técnicas sobre arquitecturas modernas de LLM y optimización de inferencia. Cubre las diferencias arquitectónicas con respecto al Transformer original (Pre-Norm, RMSNorm, SwiGLU, RoPE, GQA/MQA, MoE), explica por qué la inferencia de LLM es costosa y describe técnicas de agrupación, caché KV, cuantización y otras técnicas de aceleración.
Los LLM generativos modernos son en su mayoría transformadores de solo decodificador, con familias como GPT, LLaMA, Mistral, Qwen y Gemma que difieren en apertura, número de parámetros (desde cientos de millones hasta cientos de miles de millones), detalles de arquitectura (Denso vs. MoE), tipo de atención, normalización, codificación posicional, especificaciones de MLP, longitud del contexto (por ejemplo, 4k, 32k, 128k tokens), soporte multimodal, entrenamiento y licencia. En comparación con el transformador clásico, los LLM modernos utilizan Pre-Norm en lugar de Post-Norm (entrenamiento más estable), RMSNorm en lugar de LayerNorm (más económico), FFN con compuerta SwiGLU (más expresivo pero añade una tercera capa lineal), incrustaciones posicionales RoPE, MQA/GQA en lugar de atención de múltiples cabezas completa, a veces MoE (mezcla de expertos) para cómputo condicional, contexto más largo y optimizaciones de inferencia. La inferencia es costosa porque la generación autorregresiva lee todos los pesos por token, la caché KV crece con el contexto y el lote, y hay dos fases: prellenado (limitado por cómputo) y decodificación (limitado por memoria). La latencia (tiempo hasta el primer token, latencia entre tokens) frente a las compensaciones de rendimiento son clave; las técnicas de optimización incluyen caché KV, atención paginada, procesamiento continuo por lotes, decodificación especulativa, cuantificación y destilación.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas