типу внимания, нормализации, позиционному кодированию, особенностям MLP (multilayer perceptron — многослойный перцептрон), длине контекстного окна (например, 4k, 32k, 128k токенов), поддержке мультимодальности, обучению и лицензии. По сравнению с классическим Transformer, современные LLM используют Pre-Norm вместо Post-Norm (более стабильное обучение), RMSNorm вместо LayerNorm (дешевле в вычислении), гейтированный FFN (feed-forward network — полносвязная сеть прямого распространения) с SwiGLU (более выразительный, но добавляющий третий линейный слой), позиционные эмбеддинги RoPE (Rotary Position Embedding — вращающееся позиционное кодирование), MQA (multi-query attention — внимание с несколькими запросами) или GQA (grouped-query attention — сгруппированное внимание по запросам) вместо полного многоголового внимания, иногда MoE для условных вычислений, более длинный контекст и оптимизации инференса. Инференс обходится дорого, поскольку авторегрессивная генерация требует чтения всех весов на каждый токен, KV-cache (key-value cache — кэш ключей и значений) растёт вместе с контекстом и размером батча, а сам процесс состоит из двух фаз: prefill (заполнение, ограничено вычислениями) и decode (декодирование, ограничено памятью). Ключевую роль играет баланс между задержкой (время до первого токена, задержка между токенами) и пропускной способностью; среди техник оптимизации — KV-cache, paged attention (постраничное внимание), непрерывное батчирование (continuous batching), спекулятивное декодирование, квантование и дистилляция.