Andrew Ng présente OpenWorker : un agent IA open source pour le bureau qui livre des résultats, pas du chat
Moonshot AI
Anthropic
OpenAI
Google/DeepMind
DeepSeek
MiniMax
Alibaba/Qwen
xAI
Mistral
Together AI
Fireworks AI
Ollama
Andrew Ng a annoncé OpenWorker, un agent IA open source qui, au lieu d'engager un dialogue, produit des résultats prêts à l'emploi : un document formaté, une réponse Slack avec des données factuelles, un calendrier mis à jour. L'agent décompose les tâches en étapes, travaille avec les fichiers et applications locales, et demande une confirmation avant les actions importantes. La solution est construite sur une pile locale, utilise la bibliothèque aisuite et prend en charge 30 modèles, y compris les modèles locaux via Ollama.
Andrew Ng a présenté OpenWorker, un agent IA open source pour ordinateur de bureau qui fournit un travail finalisé plutôt que de mener une conversation. Au lieu d'un prompt, l'utilisateur spécifie le résultat attendu : un document prêt, une réponse dans Slack avec des chiffres précis, un calendrier mis à jour, une boîte de réception triée. L'agent décompose ensuite la tâche en étapes, travaille avec les fichiers locaux et les applications connectées, et demande une confirmation avant toute action significative. L'architecture comprend quatre niveaux : une interface de bureau basée sur Tauri 2 avec React 18, un serveur d'agent local en Python (FastAPI, uvicorn, port 127.0.0.1:8765), une couche de capacités et de connecteurs (outils locaux, intégrations hébergées, MCP), et un routeur de modèles construit sur la bibliothèque aisuite. OpenWorker ne fournit pas son propre service d'inférence ; l'utilisateur insère une clé API ou lance un environnement local. La liste des modèles pris en charge comprend 30 positions : fournisseurs natifs (OpenAI, Anthropic, Google), compatibles OpenAI (GLM, DeepSeek, Kimi, MiniMax, Qwen, Grok, Mistral), open-weight via Together AI et Fireworks, ainsi que des modèles entièrement locaux via Ollama (sans clé). La caractéristique clé est le moteur de permissions, qui classe chaque action en quatre classes de risque (lecture, écriture, exécution de commandes, effets externes) et prend en charge cinq modes de permissions. En mode autonome, les notifications sont envoyées dans la boîte de réception et la session est suspendue jusqu'à la réponse. La politique de sécurité impose au modèle de considérer le contenu des outils, des journaux, des pages web et des messages entrants comme des données non fiables, et non comme des instructions. La confidentialité est assurée par un traitement local : les appels de modèles sont directs, les jetons de connecteurs et les clés restent sur la machine, les secrets ne sont pas inclus dans le contexte du modèle. Le seul composant cloud est un broker optionnel pour les poignées de main OAuth (Auth0 avec PKCE), les jetons étant délivrés directement sur la machine et non stockés dans le cloud. L'application est entièrement fonctionnelle sans connexion. Le code source est disponible sur GitHub (licence MIT).
Source: MarkTechPost —
original
