ключ-значение. GQA представляет собой популярный компромисс между эффективностью и качеством. Многоголовое скрытое внимание (multi-head latent attention, MLA), используемое в DeepSeek V3, более агрессивно сжимает кэш, сохраняя при этом лучшую производительность. В статье также рассматриваются разреженное внимание и гибридные архитектуры, а для каждого варианта приведены примеры моделей. Версия постера доступна через Redbubble.