현대 LLM의 어텐션 변종 시각 가이드
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
이 글은 표준 다중 헤드 어텐션(MHA)부터 그룹 쿼리 어텐션(GQA), 다중 헤드 잠재 어텐션(MLA), 스파스 어텐션 및 하이브리드 아키텍처에 이르기까지 현대 대규모 언어 모델의 어텐션 메커니즘에 대한 시각적 개요를 제공합니다. 45개의 항목과 포스터 버전이 포함된 LLM 아키텍처 갤러리가 함께 제공됩니다.
세바스찬 라슈카(Sebastian Raschka)가 최신 LLM의 어텐션 변형들에 대한 시각적 가이드와 함께 45개 LLM 아키텍처 갤러리를 공개했습니다. 이 글은 멀티헤드 어텐션(MHA), 그 역사적 맥락, 그리고 키-값 헤드를 공유하여 KV-캐시 비용을 줄이는 그룹화 쿼리 어텐션(GQA)을 다룹니다. GQA는 효율성과 품질 사이의 인기 있는 절충안입니다. DeepSeek V3에서 사용되는 멀티헤드 잠재 어텐션(MLA)은 더 공격적으로 캐시를 압축하면서도 더 나은 성능을 유지합니다. 이 글은 또한 희소 어텐션과 하이브리드 아키텍처를 논의하며, 각 변형에 대한 예시 모델을 포함합니다. 포스터 버전은 Redbubble을 통해 이용 가능합니다.
출처: Sebastian Raschka —
원문
