大规模智能体强化学习最烧钱的地方,往往不是模型本身,而是等。等沙箱启动,等控制面调度,GPU 就在那里空转。谷歌这次给出的方案是 GKE Agent Sandbox,配套一个强化学习编排 SDK,目标很直接:把沙箱冷启动和控制面频繁调度带来的 GPU 闲置时间压下去。
沙箱冷启动是隐形成本
打开网易新闻 查看精彩图片
智能体强化学习的 rollout 阶段需要大量并行环境,每个环境通常跑在独立沙箱里。环境一多,沙箱的创建和销毁就变成高频操作,冷启动时间叠加起来,直接吃掉本该用于计算的 GPU 时间。谷歌的思路不是让模型算得更快,而是让沙箱起得更快、调度更稳。
两个组件各管一段
- GKE Agent Sandbox:负责沙箱这一层,减少冷启动开销
- RL 编排 SDK:负责调度这一层,降低控制面churn
两者配合,指向的是同一个结果——让 GPU 少等、多算。对于正在跑大规模智能体强化学习 rollout 的团队来说,这类基础设施层面的优化,往往比换一张更贵的卡更划算。
热门跟贴