Визуальное руководство по вариантам внимания в современных LLM
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Эта статья представляет визуальный обзор механизмов внимания в современных больших языковых моделях (Large Language Models, LLM), охватывая стандартное внимание с несколькими головами (Multi-Head Attention, MHA), групповое внимание к запросам (Grouped-Query Attention, GQA), многоголовое латентное внимание (Multi-Head Latent Attention, MLA), разреженное внимание и гибридные архитектуры. Статья сопровождается галереей архитектур LLM с 45 записями и версиями плакатов.
Себастьян Рашка опубликовал визуальное руководство по разновидностям механизма внимания (attention) в современных LLM, а также галерею из 45 архитектур LLM. Статья охватывает многоголовое внимание (multi-head attention, MHA), его исторический контекст и групповое запросное внимание (grouped-query attention, GQA), которое снижает затраты на KV-кэш за счет совместного использования голов
Показать ещё ↓
Источник: Sebastian Raschka —
оригинал
