PesquisaHardware e Inferência 🇷🇺 10.08.2026 23:02

Principais Perguntas de Entrevista em PLN: Arquiteturas de LLM, Inferência e Otimização

MistralMistral Google/DeepMindGoogle/DeepMind
Este artigo fornece uma lista de verificação de tópicos e perguntas-chave para entrevistas técnicas sobre arquiteturas modernas de LLM e otimização de inferência. Abrange diferenças arquiteturais do Transformer original (Pré-Normalização, RMSNorm, SwiGLU, RoPE, GQA/MQA, MoE), explica por que a inferência de LLM é cara e descreve batching, cache KV, quantização e outras técnicas de aceleração.
Os LLMs generativos modernos são, em sua maioria, transformers somente decoder, com famílias como GPT, LLaMA, Mistral, Qwen e Gemma diferindo em abertura, número de parâmetros (de centenas de milhões a centenas de bilhões), detalhes de arquitetura (Denso vs MoE), tipo de atenção, normalização, codificação posicional, especificidades do MLP, comprimento do contexto (por exemplo, 4k, 32k, 128k tokens), suporte multimodal, treinamento e licença. Em comparação com o Transformer clássico, os LLMs modernos usam Pré-Norm em vez de Pós-Norm (treinamento mais estável), RMSNorm em vez de LayerNorm (mais barato), FFN com portão SwiGLU (mais expressivo, mas adiciona uma terceira camada linear), embeddings posicionais RoPE, MQA/GQA em vez de atenção multi-cabeça completa, às vezes MoE (mistura de especialistas) para computação condicional, contexto mais longo e otimizações de inferência. A inferência é cara porque a geração autorregressiva lê todos os pesos por token, o cache de KV cresce com o contexto e o lote, e há duas fases: prefill (limitada por computação) e decode (limitada por memória). As compensações entre latência (tempo até o primeiro token, latência entre tokens) e throughput são fundamentais; as técnicas de otimização incluem cache KV, atenção paginada, batching contínuo, decodificação especulativa, quantização e destilação.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas