Forschung RSS

Forschung 🇺🇸

KV-Cache in LLMs: Verständnis und Implementierung von Grund auf

Der KV-Cache ist eine Technik für effiziente LLM-Inferenz, die Zwischenvektoren für Schlüssel und Werte speichert, um sie wiederzuverwenden und redundante Berechnungen zu vermeiden. Der Artikel erklärt das Konzept und bietet eine Implementierung von Grund auf in PyTorch, die zeigt, wie man einen Multi-Head-Attention-Mechanismus modifiziert, um Schlüssel und Werte während der Textgenerierung zu cachen.

Sebastian Raschka28.07 · 15:06
Forschung 🇺🇸

Eine visuelle Anleitung zu Aufmerksamkeitsvarianten in modernen LLMs

Dieser Artikel bietet einen visuellen Überblick über Aufmerksamkeitsmechanismen in modernen großen Sprachmodellen, von der standardmäßigen Multi-Head Attention (MHA) über Grouped-Query Attention (GQA) und Multi-Head Latent Attention (MLA) bis hin zu Sparse Attention und hybriden Architekturen. Begleitet wird er von einer LLM-Architektur-Galerie mit 45 Einträgen und Posterversionen.

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Sebastian Raschka28.07 · 15:05
Aktuelle Nachrichten