в этих моделях используются послойные эмбеддинги (per-layer embeddings, PLE) для увеличения ёмкости без расширения основного стека трансформера — эффективное количество параметров оказывается меньше общего числа, включающего эмбеддинги. Модель Laguna XS.2 от Poolside варьирует стоимость внимания по слоям: 30 слоёв со скользящим окном (размер окна 512) и 10 слоёв с полным вниманием. Модель ZAYA1-8B вводит сжатое свёрточное внимание, а DeepSeek V4 использует механизмы mHC (многоразовые головки сжатия) и сжатое внимание. Эти доработки обусловлены растущей потребностью в эффективной обработке длинного контекста в моделях рассуждений и агентных сценариях.