计算集群是 AI DLC 中承载 Ray 分布式计算任务的常驻计算实例,适用于模型训练和在线推理等需要长期运行或复用计算资源的场景。
概述
计算集群具有以下特性:
资源复用:集群创建后长期运行,作业提交后可快速获取资源,避免重复的启动开销。
弹性伸缩:工作节点组支持配置实例数区间,按负载自动扩缩。
配置继承:镜像、节点规格和存储挂载在集群创建时配置,提交到该集群的作业自动继承。
跨集群调度:通过集群组实现跨资源组错峰、异构 GPU 统一入口和主备容灾。
前提条件
已开通 AI DLC 服务并完成服务授权。
已购买资源包,并根据需要创建资源组。
AI DLC 目前为白名单开放,如需使用,请 提交申请 。
集群构成
计算集群由以下节点角色构成:
头节点:每个集群包含1个头节点组。可选启用高可用,运行主备2个头节点。
工作节点组:每个集群至少包含1个工作节点组。同一节点组内的节点规格相同,支持配置实例数区间。实例数区间的最小值与最大值相同时为固定资源,最小值小于最大值时启用弹性伸缩。
操作步骤
创建计算集群
1. 登录 DLC 控制台,在左侧导航栏选择计算集群。
2. 单击新建集群。
3. 配置基本信息。
参数 | 是否必填 | 说明 |
集群名称 | 是 | 支持中文、英文、数字和下划线,长度不超过64字符。 |
集群组 | 是 | 支持多选。 |
优先级 | 是 | 取值范围为1 - 9,默认值为5。 |
标签 | 否 | 集成腾讯云标签,用于资源分类、权限控制和成本分账。 |
4. 选择资源包与资源组。
5. 选择集群镜像。支持选择内置镜像,或填写您在容器镜像服务中的镜像地址。
注意:
构建自定义镜像时,请在
ray 用户下安装依赖。若构建过程中临时切换到 root 用户安装系统依赖,请在安装完成后切回 ray 用户,确保镜像的默认运行用户为 ray,避免运行时出现文件权限问题。6. 配置计算环境。您可以选择已保存的计算环境模板自动填充节点配置,并在此基础上调整。
头节点参数如下:
参数 | 说明 |
节点名称 | 支持自定义。 |
单节点资源类型与配额 | 从 CU 或 GU 规格中选择。 |
启用高可用 | 启用后运行主备2个同规格头节点。 |
环境变量、节点标签与逻辑资源 | 节点组级的可选配置。 |
工作节点组参数如下:
参数 | 说明 |
节点组名称 | 同一集群内唯一。 |
单节点资源类型与配额 | 从 CU 或 GU 规格中选择。 |
实例数 | 配置最小值与最大值,最小值不大于最大值。 |
环境变量、节点标签与逻辑资源 | 节点组级的可选配置。 |
说明:
启用高可用后,主节点异常时备节点自动接管,切换时间通常在30秒内。高可用会使头节点资源占用翻倍,建议在生产推理服务和长时间训练任务中启用,开发调试场景无需启用。
7. 配置存储挂载(可选)。支持挂载 COS、CFS、GooseFS 和 CFS Turbo,可设置子路径、挂载路径和读写权限。挂载配置会被提交到该集群的作业自动继承。
参数 | 说明 |
存储卷类型 | COS、CFS、GooseFS 或 CFS Turbo。 |
存储实例 | 从下拉列表中选择。 |
子路径配置类型 | 固定目录,或按实例自动生成独立子目录的动态目录。 |
子路径与挂载路径 | 指定存储侧路径与容器内挂载路径。 |
存储权限 | 读写或只读,默认为读写。只读适用于共享数据集和模型权重。 |
8. 配置高级参数(可选)。以键值对形式填写,最多20条。
9. 单击确定完成创建。
管理计算集群
在集群列表的操作列或详情页,您可以执行以下操作:
操作 | 说明 |
启动 | 使集群进入运行状态。已创建、已休眠和异常状态的集群支持启动。 |
编辑 | 修改集群配置。运行中、已休眠、已创建和异常状态支持编辑。 |
克隆 | 复制现有集群配置创建新集群。所有状态均支持克隆。 |
休眠 | 释放计算资源,保留集群配置与存储数据,计算资源不再计费。 |
删除 | 释放集群及其关联资源,删除后无法恢复。 |
说明:
创建中、启动中和休眠中属于过渡状态,此时不支持编辑集群配置。克隆集群时,集群名称需重新填写,其他配置默认沿用源集群并支持修改。
查看集群详情
在集群列表中单击集群名称,进入详情页。详情页包含以下页签:
页签 | 内容 |
基本信息 | 集群标识、名称、集群组、资源组、资源包、创建人、创建时间、镜像、标签、资源配置、存储配置和高级参数。 |
作业历史 | 提交到该集群的作业记录,包含作业标识、名称、提交命令、状态、提交时间、运行时长和日志入口。 |
操作与事件日志 | 集群层面的系统事件与用户操作记录。 |
Pod 详情 | Pod 名称、IP 地址、角色、状态、所在节点、资源请求与限制、创建时间和配置查看入口。 |
Dashboard | 集群处于运行中状态时,提供 Ray Dashboard 监控视图。 |
管理集群组
集群组是一组计算集群的逻辑集合。向集群组提交作业时,系统按调度策略从集群组内选择集群运行作业。
一个集群组可绑定多个计算集群,一个集群也可归属多个集群组。
集群组内的成员集群支持跨资源组,因此可实现跨资源组的作业调度。
当前支持随机调度策略。
集群组的典型使用场景如下:
场景 | 说明 |
跨资源组错峰 | 将负载高峰时段不同的集群绑定至同一集群组,实现资源互补。 |
异构 GPU 统一入口 | 将不同 GPU 型号的集群按用途分组,用户按用途提交作业,无需选择具体集群。 |
主备容灾 | 将主用集群与备用集群绑定至同一集群组,提升服务可用性。 |
在集群创建页或编辑页单击管理集群组,可创建集群组或修改集群组名称。
注意:
删除集群组时,组内的集群会迁移到您指定的目标集群组,集群本身不受影响。引用被删除集群组的作业配置不会自动更新,再次提交作业时将因目标集群组不存在而失败,请及时修改作业配置。
常见问题
为什么建议先创建集群再提交作业?
按需拉起集群方式下,作业需要先创建头节点和工作节点,通常需要数分钟。使用常驻集群时,作业可快速获取资源,适用于多次提交作业或对启动时延敏感的场景。
工作节点组配置实例数区间后如何触发扩容?
由 Ray 自动伸缩机制根据待调度任务的资源请求触发。扩容时的节点总量不超过资源组的可分配剩余配额。
休眠集群与删除集群有什么区别?
休眠会释放计算资源,保留集群配置与存储数据,后续可再次启动。删除会释放集群及其全部关联资源,且无法恢复。
多个作业提交到同一集群时资源如何分配?
集群的头节点与工作节点由集群上的作业共享,Ray 按任务和 Actor 的资源请求进行调度。每个作业额外占用一个轻量的作业驱动进程,不计入资源配额。