⚡ СРОЧНО
ИсследованияМодели 🇺🇸 27.07.2026 13:06

Инновации в архитектуре LLM: разделение KV, послойные эмбеддинги и сжатое внимание

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Себастиан Рашка анализирует недавние достижения в архитектуре больших языковых моделей с открытыми весами, ориентированные на эффективность работы с длинным контекстом. Ключевые методы включают разделение KV между слоями (Gemma 4), послойные эмбеддинги (Gemma 4 E2B/E4B), послойное бюджетирование внимания (Laguna XS.2), сжатое свёрточное внимание (ZAYA1) и mHC со сжатым вниманием (DeepSeek V4). Эти подходы сокращают размер кэша KV и объём памяти, необходимый для рассуждений и выполнения агентских сценариев.
Себастьян Рашка анализирует недавние изменения в архитектуре открытых больших языковых моделей, направленные на снижение затрат при работе с длинным контекстом. В моделях Gemma 4 E2B/E4B последние слои повторно используют состояния «ключ-значение» из ранних слоёв (межслойное внимание), что позволяет сократить размер кэша KV примерно наполовину (например, до 2.7 ГБ при контексте 128K). Кроме того,
Показать ещё ↓
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости