Tencent publie en open source AngelSpec : un framework d'entraînement unifié pour le décodage spéculatif MTP et par blocs parallèles sur les modèles Hy3
Tencent
Tencent a publié AngelSpec, un framework d'entraînement open source pour les modèles de brouillon de décodage spéculatif, prenant en charge à la fois la prédiction multi-tokens autorégressive (MTP) et la famille FlashD en blocs parallèles. Le framework traite l'hétérogénéité de la charge de travail en spécialisant la structure, les données d'entraînement et la profondeur de vérification pour différents domaines. Les premiers résultats montrent que DFly atteint une longueur moyenne acceptée allant jusqu'à 4,79 sur Hy3-A21B, soit une amélioration de 59,7% par rapport à MTP.
Tencent a open-sourcé AngelSpec, un framework d'entraînement natif PyTorch pour les modèles de brouillon en décodage spéculatif. Il couvre à la fois la prédiction autorégressive multi-token (MTP) et la famille DFlash parallèle par blocs, incluant une nouvelle architecture DFly. AngelSpec traite l'hétérogénéité de la charge de travail comme une contrainte de premier ordre, offrant des générateurs de brouillon complémentaires pour différents domaines : MTP pour les données conversationnelles et la diffusion par blocs pour le code et les mathématiques. Le chemin MTP utilise un schéma à profondeurs multiples avec paramètres partagés et déploiement du modèle cible pour résoudre le décalage entraînement-inférence. DFly introduit un conditionnement hybride par cible et une tête autorégressive conditionnée par le prédécesseur. Sur Qwen3-8B, DFly atteint une longueur acceptée moyenne de 5,41, et sur Hy3-A21B, 4,79 contre 3,69 pour DFlash et 3,00 pour MTP. Le framework est construit sur TorchSpec avec des fonctionnalités telles que le déploiement TTT, l'entraînement sur contextes longs jusqu'à 128 000 tokens, et le regroupement de séquences avec conscience documentaire. Sept points de contrôle sont disponibles sur Hugging Face et ModelScope.
Source: MarkTechPost —
original
