ModelleAgenten 🇨🇳 27.07.2026 06:02

Ant Bailing veröffentlicht neues hybrides Reasoning-Modell Ling-3.0-Flash

Ant Bailing hat offiziell sein neues natives hybrides Reasoning-Modell Ling-3.0-Flash veröffentlicht. Es verfügt über insgesamt 124 Milliarden Parameter, von denen pro Berechnung nur 5,1 Milliarden aktiviert werden. In Aufgaben wie Reasoning, Befolgung von Anweisungen und Langzeitkontext erreicht oder übertrifft es Modelle, die zwei- bis dreimal so groß sind, und bietet dabei eine höhere Effizienz. Das Modell ist auf OpenRouter für eine begrenzte kostenlose Woche verfügbar, bevor es als Open Source veröffentlicht wird.
Am 24. Juli brachte Ant Bailing das Modell Ling-3.0-Flash auf den Markt, das über insgesamt 124 Milliarden Parameter verfügt und pro Schritt 5,1 Milliarden aktiviert. Es erreicht eine Leistung, die mit zwei- bis dreimal größeren Modellen vergleichbar ist, und senkt gleichzeitig die Rechenkosten. Das Modell wurde für Agent-Anwendungen mit über 10.000 realen Interaktionsumgebungen entwickelt und verfügt über verbesserte Selbstkorrektur- und Langzeitplanungsfähigkeiten. Es verwendet eine hybride Aufmerksamkeitsarchitektur mit einem Verhältnis von 5:1 zwischen KDA-linearer Aufmerksamkeit und MLA-Schichten und verbessert Lightning Attention zu KDA für eine bessere Zustandsverfolgung. Die Expertenaktivierung pro Token wird von 1/32 auf 1/64 reduziert, was die Effizienz steigert. Zu den technischen Verbesserungen gehören ein Cluster-Level-Caching, das die Latenzzeit für das erste Token um 60 bis 80 Prozent reduziert, sowie ein Multi-Agenten-Kollaborationsframework zur Stabilisierung.
Quelle: QbitAI 量子位 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten