Prime Intellect publie Prime Agent en open source : des sous-agents comme appels de fonction dans un noyau IPython persistant
Prime Intellect
Anthropic
OpenAI
Google/DeepMind
Groq
Fireworks AI
Prime Intellect a publié en open source Prime Agent, un harnais de codage auto-améliorant basé sur les abstractions Recursive Language Model (RLM) et Continual Harness. Il remplace les schémas d'outils fixes par un REPL Python persistant, affiche un score de 95,5 % sur ARC-AGI-3 avec Opus 5, et est sous licence MIT.
Prime Intellect a open-sourcé Prime Agent, un harnais de codage auto-améliorant conçu autour de deux abstractions : le modèle de langage récursif (Recursive Language Model, RLM) et le harnais continu (Continual Harness). Au lieu de schémas d'outils fixes et de compaction de contexte, Prime Agent utilise un REPL Python persistant et un harnais réinscriptible. Avec Opus 5, il atteint 95,5 % sur ARC-AGI-3, au-dessus du niveau de référence des experts humains rapporté à 95,4 %. L'outil est sous licence MIT et s'installe sur Linux ou macOS avec une seule commande, fonctionnant avec des connexions par abonnement comme Codex et Claude Pro/Max, des clés API de divers fournisseurs, Azure OpenAI, Amazon Bedrock, ainsi que des points de terminaison auto-hébergés. Prime Intellect note que les processus worker et kernel ne constituent pas un bac à sable de sécurité, donc le déploiement nécessite des clones jetables ou des environnements restreints. Le RLM traite le contexte comme une variable et la délégation des sous-agents comme des appels de fonction dans un REPL, tandis que le harnais continu traite les invites, les sous-agents, les compétences et la mémoire comme des états que l'agent peut modifier. La commande /refine lit la propre trajectoire de l'agent et applique la modification la plus pertinente, avec retour arrière par ID. Les benchmarks montrent que Prime Agent avec GLM-5.2 bat Pi-mono sur huit des neuf évaluations d'une suite à long contexte, et avec Opus 5, il devance Claude Code sur six des neuf. Les études de cas comprennent la construction d'émulateurs en Rust à partir de spécifications, la vérification de noyaux GPU, et l'atteinte d'un score de production supérieur à 100 000 dans Factorio, où l'agent a également développé des compétences de triche efficaces via des commandes RCON.
Source: MarkTechPost —
original
