亚马逊云科技今日宣布,SageMaker HyperPod新增对Ray框架的支持,将Ray与HyperPod专为基础模型训练和推理打造的基础设施深度集成。此前,在Kubernetes上运行Ray集群,数据科学家需要手动编写YAML清单、为每次依赖变更重建Docker镜像、配置kubectl端口转发才能访问Ray Dashboard,还要手工搭建Prometheus和Grafana监控体系。
现在,这些繁琐操作全部省去。通过SageMaker Studio,数据科学家可以直接创建Ray集群、打开Ray Dashboard和Amazon Managed Grafana监控面板、将JupyterLab或Code Editor工作区连接到集群、提交分布式任务,并配置挂起任务检测——全程可视化操作,无需接触底层配置文件。
训练与推理的可靠性提升
在应用层面,Ray训练任务获得了HyperPod节点健康监控与自动恢复带来的容错能力。配合HyperPod分布式分层存储,系统支持分层检查点(tiered checkpointing)机制,故障恢复时能更快地从检查点续跑,减少训练中断造成的算力浪费。
推理侧同样有针对性优化。SageMaker JumpStart集成可直接将模型权重加载到Ray Serve端点,并通过将KV缓存卸载到分层存储,支撑长上下文请求的推理场景。这意味着处理超长文本时,显存压力得到有效缓解。
兼容现有工作流,零代码改造
值得强调的是,这些新能力完全基于开源的KubeRay和标准Ray API构建。也就是说,团队现有的Ray脚本和分布式工作流无需任何修改,即可直接迁移到HyperPod上运行,迁移成本被压到最低。
要使用这些功能,用户需要准备一个由Amazon EKS编排的SageMaker HyperPod集群,并安装四个关键组件:SageMaker Spaces EKS插件(提供JupyterLab和Code Editor交互式开发环境)、HyperPod Observability EKS插件(采集Ray指标并配置Grafana面板)、KubeRay运算符(管理RayCluster、RayJob、RayService资源),以及HyperPod Ray Endpoint运算符(生成用于仪表盘访问和远程任务提交的认证公共端点)。
完整的部署指引已发布在Ray on HyperPod官方入门指南中。对于正在Kubernetes上苦于运维Ray集群的团队来说,这套方案把基础设施的复杂性收走,让数据科学家把精力放回算法和模型本身。
热门跟贴