Forschung RSS

Forschung 🇺🇸

LLM-Architektur-Innovationen: KV-Sharing, Embeddings pro Schicht und komprimierte Aufmerksamkeit

Sebastian Raschka gibt einen Überblick über aktuelle Fortschritte bei Open-Weight-LLM-Architekturen, die sich auf die Effizienz langer Kontexte konzentrieren. Zu den wichtigsten Techniken gehören KV-Sharing über Schichten hinweg (Gemma 4), Embeddings pro Schicht (Gemma 4 E2B/E4B), schichtweise Aufmerksamkeitsbudgetierung (Laguna XS.2), komprimierte convolutional attention (ZAYA1) sowie mHC mit komprimierter Aufmerksamkeit (DeepSeek V4). Diese reduzieren die KV-Cache-Größe und den Speicherverkehr für Reasoning- und Agent-Workflows.

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Sebastian Raschka27.07 · 13:06
Forschung 🇷🇺

6 Lektionen für die Erstellung von Benchmarks aus dem NeurIPS-Tutorial

Die Autoren von SWE-bench und GPQA diskutierten auf dem NeurIPS wesentliche Fehler bei der Erstellung von Benchmarks: Tyrannei der Metriken, Subjektivität des Crowdsourcings, Gefahr der Verwendung von LLMs als Evaluatoren und die Notwendigkeit dynamischer Tests. Die wichtigsten Ratschläge: gesättigte Benchmarks vermeiden, Multimodalität prüfen und Ergebnisse mit Konfidenzintervallen veröffentlichen.

Google DeepMindGoogle DeepMind
Хабр — Data Mining27.07 · 13:06
Aktuelle Nachrichten