AgentesCódigo Aberto 🇺🇸 28.07.2026 00:01

Times da Kimi e kvcache-ai disponibilizam código aberto do AgentENV — uma plataforma distribuída para treinar RL de agentes na escala do Kimi K3

Moonshot AIMoonshot AI
A equipe da Moonshot AI e o kvcache-ai lançaram o AgentENV (AENV) sob a licença MIT — um sistema distribuído para executar ambientes de agente usando micro-VMs do Firecracker. Ele permite criação rápida de sandboxes, pausa, retomada e bifurcação, acelerando o treinamento de RL de agentes para o modelo Kimi K3 (2,8 trilhões de parâmetros, MoE). O projeto suporta compatibilidade com o E2B, simplificando a migração de agentes existentes.
A equipe Moonshot AI (criadora do modelo Kimi K3), em parceria com a kvcache-ai, disponibilizou como código aberto (licença MIT) a plataforma AgentENV — um sistema distribuído para execução em larga escala de ambientes para agentes, utilizado no treinamento por aprendizado por reforço (RL) do modelo mistura de especialistas (MoE) de 2,8 trilhões de parâmetros, o Kimi K3. Cada sandbox é uma micro-VM Firecracker com seu próprio kernel Linux, sistema de arquivos e namespace de rede, oferecendo isolamento a nível de kernel. O gerenciamento do ciclo de vida dos sandboxes é feito por meio de uma API HTTP Axum que direciona requisições a um orquestrador. O sistema de arquivos raiz (rootfs) opera com ublk no espaço do usuário, utilizando overlaybd para imagens em camadas: as camadas base são somente leitura e compartilhadas entre sandboxes, enquanto cada sandbox possui sua própria camada superior gravável. Dentro da VM convidada, o daemon envd (porta 49983) lida com comandos, operações de arquivo e relatórios de status; um proxy reverso roteia tráfego HTTP e WebSocket de clientes para serviços da VM. Atenção especial é dada à redução de sobrecarga: o cache de páginas do host é compartilhado entre dados de armazenamento e snapshots de memória, e um mecanismo de ballooning de memória permite recuperar memória excedente da VM convidada para o host, suportando overcommit à medida que os ambientes divergem. Principais funcionalidades incluem snapshot, pausa, retomada e fork. Os snapshots são incrementais, não completos. De acordo com dados reportados, carregar ou retomar a partir de um snapshot leva menos de 50 ms, pausar menos de 100 ms, e snapshots incrementais, mesmo sob carga pesada de escrita, são concluídos em menos de 100 ms. A funcionalidade de fork, específica para RL, permite clonar um sandbox em execução em até 16 sandboxes filhos independentes no mesmo nó. O sandbox pai é brevemente pausado durante a captura e depois retomado. Todas as instâncias filhas herdam o sistema de arquivos, memória e configuração de recursos do pai. Isso permite que uma configuração cara (instalação de dependências, clonagem de repositórios) seja realizada uma vez, e então o estado é bifurcado em execuções paralelas. Os snapshots são salvos em armazenamento compatível com S3 ou em um sistema de arquivos distribuído. Por padrão, cada sandbox possui um TTL (time to live); ao expirar, ele não é excluído, mas pausado; para deletá-lo, é necessário passar autoPause: false na criação. As imagens são carregadas sob demanda via overlaybd com um cache de disco local que armazena dados quentes e remove dados frios. Isso evita o pré-aquecimento de cada imagem em todos os nós e pode exceder a capacidade do disco local. O estado é organizado em três camadas: um espaço de trabalho do coletor para artefatos, um repositório de snapshots (armazenamento persistente) e um cache de tempo de execução local para configurações derivadas. Dois backends de repositório são suportados: posix_fs (padrão) e oss (via um cliente comum compatível com S3, a região deve ser explicitamente especificada). Um transporte P2P opcional baseado em iroh pode anunciar artefatos para nós vizinhos, mas está desabilitado por padrão. Para armazenamento compartilhado, é recomendada uma largura de banda mínima de 1 Gbit/s, e fortemente recomendada 10 Gbit/s ou superior. Para uma transição fácil, o AgentENV fornece uma API HTTP compatível com o E2B: basta definir E2B_API_URL para seu próprio servidor, e os SDKs oficiais do E2B para Python e TypeScript funcionarão sem alterações de código nos agentes. Uma CLI nativa, aenv, também está disponível. A implantação requer Linux 6.8+ e /dev/kvm; o script de instalação tem como alvo o Ubuntu 24.04. A CLI é compatível com Linux e macOS em x86_64 e arm64, enquanto o servidor requer Linux (precisa de KVM). Cinco métodos de implantação são documentados: um script de instalação com systemd, uma imagem Docker, Docker Compose para simulação de cluster, manifestos Kubernetes com gateway, scheduler e DaemonSet, e compilação a partir do código-fonte Rust. Em implantações com vários nós, são adicionados um gateway na porta 8080 e um scheduler na porta 9090.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas