智能体开源 🇺🇸 28.07.2026 00:01

Kimi与kvcache-ai团队开源AgentENV——面向Kimi K3规模的智能体强化学习训练分布式平台

Moonshot AIMoonshot AI
Moonshot AI团队与kvcache-ai以MIT许可证发布了AgentENV(AENV)——一个使用Firecracker微虚拟机运行智能体环境的分布式系统。它支持快速沙箱创建、暂停、恢复和分叉,加速针对Kimi K3模型(2.8万亿参数,MoE)的智能体强化学习训练。该项目兼容E2B,简化了现有智能体的迁移。
Moonshot AI团队(Kimi K3模型创建者)与kvcache-ai联合开源(MIT协议)了AgentENV平台——一个用于大规模执行智能体环境的分布式系统,用于对其2.8万亿参数的混合专家(MoE)模型Kimi K3进行强化学习(RL)训练。每个沙箱都是一个Firecracker微虚拟机,拥有自己的Linux内核、文件系统和网络命名空间,提供内核级隔离。沙箱生命周期管理通过Axum HTTP API处理,该API将请求路由到编排器。根文件系统通过用户空间中的ublk运行,使用overlaybd实现分层镜像:基础层是只读的,并在沙箱间共享,而每个沙箱都有自己可写的上层。在客户虚拟机内,envd守护进程(端口49983)处理命令、文件操作和状态报告;反向代理将来自客户端的HTTP和WebSocket流量路由到虚拟机服务。特别注重减少开销:主机页面缓存在存储数据和内存快照之间共享,内存气球机制允许将多余的客户内存回收给主机,支持随着环境分化而过度提交。关键特性包括快照、暂停、恢复和分支。快照是增量的,而非全量。根据报告数据,从快照加载或恢复耗时不到50毫秒,暂停不到100毫秒,而增量快照即使在大量写入负载下也能在100毫秒内完成。分支特性专为强化学习设计,允许将正在运行的沙箱克隆到同一节点上最多16个独立的子沙箱中。父沙箱在捕获期间短暂暂停,然后恢复。所有子实例继承父沙箱的文件系统、内存和资源配置。这使得昂贵的设置(安装依赖项、克隆仓库)只需执行一次,然后将状态分支到并行运行中。快照保存到兼容S3的对象存储或分布式文件系统。默认情况下,每个沙箱都有生存时间(TTL);到期后,它不会被删除,而是暂停;要删除它,必须在创建时传递`autoPause: false`。镜像通过overlaybd按需加载,并带有本地磁盘缓存,用于存储热数据并驱逐冷数据。这避免了在所有节点上预热每个镜像,并且可以超出本地磁盘容量。状态分为三层:用于工件的工作区收集器、快照仓库(持久存储)和用于派生配置的本地运行时缓存。支持两种仓库后端:`posix_fs`(默认)和`oss`(通过通用的S3兼容客户端,必须显式指定区域)。基于iroh的可选P2P传输可以将工件通告给相邻节点,但默认禁用。对于共享存储,建议最低带宽为1 Gbit/s,强烈建议达到10 Gbit/s或更高。为便于过渡,AgentENV提供了兼容E2B的HTTP API:只需将`E2B_API_URL`设置为自己的服务器,官方E2B Python/TypeScript SDK无需修改代码即可用于智能体。还提供了原生CLI工具`aenv`。部署要求Linux 6.8+和`/dev/kvm`;安装脚本针对Ubuntu 24.04。CLI支持Linux和macOS的x86_64及arm64架构,而服务器要求Linux(需要KVM)。文档记录了五种部署方法:使用systemd的安装脚本、Docker镜像、用于集群模拟的Docker Compose、包含网关、调度器和DaemonSet的Kubernetes清单,以及从Rust源码构建。在多节点部署中,会添加一个端口8080上的网关和一个端口9090上的调度器。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻