Forschung RSS

Modelle 🇨🇳

Von GPT-2 bis Kimi K3: Maßstab wächst 22.580-fach in sieben Jahren, Hauptarchitektur-Thread baut ein „Memory-Betriebssystem“

Die technische Evolution großer Modelle von GPT-2 bis Kimi K3 zeigt, wie sich die KI-Architektur vom „Sich-an-alles-Erinnern“ zum „Selektiven Gedächtnis“ bewegt. KV Cache löst das Problem der Generierungseffizienz, Lineare Aufmerksamkeit erforscht effizienteres Langzeitgedächtnis, DeltaNet und Kimi Linear ermöglichen Modellen, Informationen zu lernen, zu aktualisieren, zu vergessen und zu verwalten. Kimi K3 hat 2,8 Billionen Parameter, das entspricht etwa 22.580 GPT-2-Modellen.

Moonshot AIMoonshot AI
InfoQ 中国30.07 · 13:02
Aktuelle Nachrichten