Fireworks AI lance Fireworks Nexus : une couche de routage et de contrôle des coûts qui déplace les tâches de codage courantes vers les modèles ouverts
Fireworks AI
Anthropic
Moonshot AI
OpenAI
Fireworks AI a lancé Fireworks Nexus, une plateforme de gestion et de routage de l’IA destinée aux organisations d’ingénierie. Elle réduit les coûts en redirigeant les tâches de codage courantes vers des modèles ouverts tout en réservant les tâches difficiles aux modèles de pointe. Des évaluations indépendantes réalisées par Faros AI et Arize confirment cette approche, montrant des réductions de coûts de 3 à 5 fois et une amélioration de l’efficacité.
Fireworks AI a dévoilé Fireworks Nexus, une plateforme de gestion et d'orientation de l'IA destinée aux organisations d'ingénierie. Elle connecte les outils de codage existants à une couche gérée de modèles à poids ouverts, répondant aux inefficacités de coût lorsque des tâches routinières sont exécutées sur des modèles de pointe onéreux. Nexus se compose de trois éléments : des contrôles d'entreprise et une observabilité des coûts, une continuité de flux de travail via FireConnect (une installation en une ligne sous licence Apache 2.0), et une gestion intelligente du trafic utilisant un modèle sur mesure qui évalue la difficulté des requêtes. Le routeur est en phase d'aperçu de recherche, dirigeant actuellement le trafic entre Claude Opus 5 et GLM-5.2 avec un pass-through de clé Anthropic, ou entre Kimi K3 et GLM-5.2 en mode tout ouvert. Des tests préliminaires avec Notion et Doximity ont montré une réduction de 33 % du coût par pull request fusionnée. Faros AI a évalué 211 tâches d'ingénierie réelles sur sept routes, constatant que Claude Code sur GLM-5.2 obtenait un score de 0,568 contre 0,521 pour Claude Code sur Opus 4.8, avec des coûts de 0,92 $ contre 1,76 $ par tâche. Arize a évalué 10 modèles sur 40 tâches Terminal-Bench avec 2 400 exécutions, montrant qu'une échelle d'escalade délibérée surpassait toutes les stratégies à modèle unique, avec un coût de 0,525 $ par tâche réussie et 32,3 tâches sur 40 résolues, contre 0,636 $ et 25/40 pour GPT-5.5 seul. Trois voies de déploiement existent : le plugin FireConnect, la configuration directe de l'API, ou le routeur placé devant un contrat de modèle de pointe.
Source: MarkTechPost —
original
