⚡ СРОЧНО
Инновации в архитектуре LLM: разделение KV, послойные эмбеддинги и сжатое внимание
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Себастиан Рашка анализирует недавние достижения в архитектуре больших языковых моделей с открытыми весами, ориентированные на эффективность работы с длинным контекстом. Ключевые методы включают разделение KV между слоями (Gemma 4), послойные эмбеддинги (Gemma 4 E2B/E4B), послойное бюджетирование внимания (Laguna XS.2), сжатое свёрточное внимание (ZAYA1) и mHC со сжатым вниманием (DeepSeek V4). Эти подходы сокращают размер кэша KV и объём памяти, необходимый для рассуждений и выполнения агентских сценариев.
Себастьян Рашка анализирует недавние изменения в архитектуре открытых больших языковых моделей, направленные на снижение затрат при работе с длинным контекстом. В моделях Gemma 4 E2B/E4B последние слои повторно используют состояния «ключ-значение» из ранних слоёв (межслойное внимание), что позволяет сократить размер кэша KV примерно наполовину (например, до 2.7 ГБ при контексте 128K). Кроме того,
Показать ещё ↓
Источник: Sebastian Raschka —
оригинал
