Andrew Ng Apresenta OpenWorker: Um Agente de IA de Código Aberto para Desktop que Entrega Resultados, Não Conversas
Moonshot AI
Anthropic
OpenAI
Google/DeepMind
DeepSeek
MiniMax
Alibaba/Qwen
xAI
Mistral
Together AI
Fireworks AI
Ollama
Andrew Ng anunciou o OpenWorker, um agente de IA de código aberto que, em vez de engajar em diálogo, produz resultados prontos: um documento formatado, uma resposta no Slack com dados factuais, um calendário atualizado. O agente divide tarefas em etapas, trabalha com arquivos e aplicativos locais e solicita confirmação antes de ações significativas. A solução é construída em uma pilha local, usa a biblioteca aisuite e suporta 30 modelos, incluindo modelos locais via Ollama.
Andrew Ng apresentou o OpenWorker — um agente de IA desktop open source que entrega trabalho pronto, em vez de conduzir uma conversa. Em vez de um prompt, o usuário especifica o resultado esperado: um documento finalizado, uma resposta no Slack com números exatos, um calendário atualizado, uma caixa de entrada organizada. O agente então divide a tarefa em etapas, trabalha com arquivos locais e aplicativos conectados e, antes de qualquer ação significativa, solicita confirmação. A arquitetura inclui quatro camadas: um shell desktop em Tauri 2 com React 18, um servidor de agente local em Python (FastAPI, uvicorn, porta 127.0.0.1:8765), uma camada de capacidades e conectores (ferramentas locais, integrações hospedadas, MCP) e um roteador de modelos construído sobre a biblioteca aisuite. O OpenWorker não fornece um serviço de inferência próprio — o usuário insere uma chave de API ou executa um ambiente local. A lista de modelos suportados inclui 30 itens: provedores nativos (OpenAI, Anthropic, Google), compatíveis com OpenAI (GLM, DeepSeek, Kimi, MiniMax, Qwen, Grok, Mistral), de peso aberto via Together AI e Fireworks, e totalmente locais via Ollama (sem chave). Uma característica chave é o mecanismo de permissões, que classifica cada ação em quatro classes de risco (leitura, escrita, execução de comandos, efeitos externos) e suporta cinco modos de permissão. No modo autônomo, as notificações são enviadas para a caixa de entrada e a sessão é pausada até a resposta. A política de segurança determina que o modelo considere o conteúdo de ferramentas, logs, páginas web e mensagens recebidas como dados não confiáveis, e não como instruções. A privacidade é garantida pelo processamento local: as chamadas de modelo vão diretamente, os tokens dos conectores e as chaves permanecem na máquina, e os segredos não entram no contexto do modelo. O único componente em nuvem é um broker opcional para handshakes OAuth (Auth0 com PKCE); os tokens são emitidos diretamente na máquina e não são armazenados na nuvem. O aplicativo é totalmente funcional sem login. O código-fonte está disponível no GitHub (licença MIT).
Fonte: MarkTechPost —
original
