ModèlesAgents 🇨🇳 27.07.2026 06:02

Ant Bailing publie son nouveau modèle de raisonnement hybride Ling-3.0-Flash

Ant Bailing a officiellement publié son nouveau modèle de raisonnement hybride natif, Ling-3.0-Flash, doté de 124 milliards de paramètres au total, dont seulement 5,1 milliards activés par calcul. Il égale ou dépasse des modèles de 2 à 3 fois sa taille dans les tâches de raisonnement, de suivi d'instructions et de contexte long, offrant une plus grande efficacité. Le modèle est disponible sur OpenRouter pour une semaine gratuite limitée avant d'être open-source.
Le 24 juillet, Ant Bailing a lancé le modèle Ling-3.0-Flash avec 124 milliards de paramètres totaux et 5,1 milliards activés par étape, atteignant des performances comparables à celles de modèles deux à trois fois plus grands tout en réduisant les coûts de calcul. Conçu pour les applications agents avec plus de 10 000 environnements d'interaction réels, il offre une meilleure autocorrection et une planification à long terme. Le modèle utilise une architecture d'attention hybride avec un ratio de 5:1 entre l'attention linéaire KDA et les couches MLA, et met à niveau Lightning Attention vers KDA pour un meilleur suivi des états. L'activation d'experts par token est réduite de 1/32 à 1/64, ce qui améliore l'efficacité. Les améliorations techniques incluent une mise en cache au niveau du cluster réduisant la latence du premier token de 60 à 80 % et un cadre de collaboration multi-agents pour la stabilité.
Source: QbitAI 量子位 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches