объясняет эволюцию механизмов внимания: MHA (Multi-Head Attention, 2017), GQA (Grouped Query Attention, 2023), MLA (Multi-Head Latent Attention, 2024) от DeepSeek и DSA (Dynamic Sparse Attention, 2025) в DeepSeek v3.2, каждый из которых уменьшает размер KV-кэша. Движки инференса vLLM (открытый исходный код) использует PagedAttention для уменьшения фрагментации памяти, а SGLang (открытый исходный код) — RadixAttention для более гибкого кэширования префиксов. Для оборудования рекомендуется SGLang для H100 и выше, vLLM — для Ampere и старше. Оптимальный вариант для одного узла (8x H100, 640 ГБ видеопамяти) — модели MoE (Mixture of Experts) до ~120B или плотные модели до ~32B. Tensor Parallelism (TP) снижает задержку, Data Parallelism (DP) максимизирует пропускную способность. Разделение Prefill/Decode дает наибольшую пропускную способность, но требует больше инженерных усилий. Спекулятивное декодирование не является панацеей, так как ухудшается при высокой степени параллелизма. Статья завершается чек-листом для производственного развертывания.