AgentenOpen Source 🇺🇸 28.07.2026 00:01

Kimi en kvcache-ai Teams open-sourcen AgentENV — een gedistribueerd platform voor het trainen van agent-RL op Kimi K3-schaal

Moonshot AIMoonshot AI
Het Moonshot AI-team en kvcache-ai hebben AgentENV (AENV) uitgebracht onder de MIT-licentie — een gedistribueerd systeem voor het uitvoeren van agent-omgevingen met behulp van Firecracker micro-VM's. Het maakt snelle sandbox-creatie, pauzeren, hervatten en forken mogelijk, wat de agent-RL-training voor het Kimi K3-model (2,8 biljoen parameters, MoE) versnelt. Het project ondersteunt compatibiliteit met E2B, waardoor migratie van bestaande agenten wordt vereenvoudigd.
Het Moonshot AI-team (maker van het Kimi K3-model) heeft samen met kvcache-ai het AgentENV-platform open-source gemaakt (MIT) — een gedistribueerd systeem voor grootschalige uitvoering van agent-omgevingen, gebruikt voor reinforcement learning (RL)-training van hun 2,8 biljoen parameter mixture-of-experts (MoE)-model Kimi K3. Elke sandbox is een Firecracker micro-VM met een eigen Linux-kernel, bestandssysteem en netwerk-naamruimte, wat kernel-level isolatie biedt. Het beheer van de sandbox-levenscyclus wordt afgehandeld via een Axum HTTP-API die verzoeken naar een orchestrator routeert. Het rootfs-bestandssysteem draait via ublk in userspace, met overlaybd voor gelaagde images: basislagen zijn alleen-lezen en worden gedeeld tussen sandboxes, terwijl elke sandbox zijn eigen beschrijfbare bovenlaag heeft. Binnen de gast-VM verzorgt de envd-daemon (poort 49983) opdrachten, bestandsbewerkingen en statusrapporten; een reverse proxy routeert HTTP- en WebSocket-verkeer van clients naar VM-services. Er wordt speciale aandacht besteed aan het verminderen van overhead: de host-pagecache wordt gedeeld tussen opslaggegevens en geheugensnapshots, en een memory ballooning-mechanisme maakt het mogelijk overtollig gastgeheugen terug te winnen naar de host, wat overcommit ondersteunt naarmate omgevingen uiteenlopen. Belangrijke functies zijn snapshotting, pauzeren, hervatten en forken. Snapshots zijn incrementeel, niet volledig. Volgens gerapporteerde gegevens duurt het laden of hervatten van een snapshot minder dan 50 ms, pauzeren minder dan 100 ms, en incrementele snapshots zijn, zelfs bij zware schrijflast, binnen 100 ms voltooid. De fork-functie, specifiek voor RL, maakt het mogelijk een draaiende sandbox te klonen in maximaal 16 onafhankelijke child-sandboxes op hetzelfde knooppunt. De parent-sandbox wordt kort gepauzeerd tijdens de capture en vervolgens hervat. Alle child-exemplaren erven het bestandssysteem, geheugen en resourceconfiguratie van de parent. Hierdoor kan dure setup (installeren van afhankelijkheden, klonen van repositories) eenmalig worden uitgevoerd, waarna de toestand wordt geforkt naar parallelle runs. Snapshots worden opgeslagen in S3-compatibele objectopslag of een gedistribueerd bestandssysteem. Standaard heeft elke sandbox een TTL; bij verlopen wordt deze niet verwijderd maar gepauzeerd; om hem te verwijderen moet je bij aanmaak autoPause: false meegeven. Images worden on-demand geladen via overlaybd met een lokale schijf-cache die hot data opslaat en cold data verwijdert. Dit voorkomt dat elke image op alle knooppunten moet worden voorverwarmd en kan de lokale schijfcapaciteit overschrijden. De status is georganiseerd in drie lagen: een collector-werkruimte voor artifacts, een snapshot-opslagplaats (blijvende opslag), en een lokale runtime-cache voor afgeleide configuraties. Twee opslag-backends worden ondersteund: posix_fs (standaard) en oss (via een gemeenschappelijke S3-compatibele client, regio moet expliciet worden opgegeven). Een optioneel P2P-transport op basis van iroh kan artifacts aan aangrenzende knooppunten adverteren, maar is standaard uitgeschakeld. Voor gedeelde opslag wordt een minimale bandbreedte van 1 Gbit/s aanbevolen, en 10 Gbit/s of hoger wordt sterk aanbevolen. Voor een gemakkelijke overgang biedt AgentENV een E2B-compatibele HTTP-API: stel gewoon de E2B_API_URL in op je eigen server, en de officiële E2B Python/TypeScript-SDK's werken zonder code-aanpassingen aan agents. Een native CLI, aenv, is ook beschikbaar. Implementatie vereist Linux 6.8+ en /dev/kvm; het installatiescript richt zich op Ubuntu 24.04. De CLI ondersteunt Linux en macOS op x86_64 en arm64, terwijl de server Linux nodig heeft (vereist KVM). Vijf implementatiemethoden zijn gedocumenteerd: een installatiescript met systemd, een Docker-image, Docker Compose voor clustersimulatie, Kubernetes-manifesten met gateway, scheduler en DaemonSet, en bouwen vanuit Rust-broncode. In implementaties met meerdere knooppunten worden een gateway op poort 8080 en een scheduler op poort 9090 toegevoegd.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws