帮你快速理解、总结文档立即下载
文档中心>数据湖计算 DLC

计算集群

最近更新时间:2026-08-14 18:22:33
我的收藏
计算集群是 AI DLC 中承载 Ray 分布式计算任务的常驻计算实例,适用于模型训练和在线推理等需要长期运行或复用计算资源的场景。

概述

计算集群具有以下特性:
资源复用:集群创建后长期运行,作业提交后可快速获取资源,避免重复的启动开销。
弹性伸缩:工作节点组支持配置实例数区间,按负载自动扩缩。
配置继承:镜像、节点规格和存储挂载在集群创建时配置,提交到该集群的作业自动继承。
跨集群调度:通过集群组实现跨资源组错峰、异构 GPU 统一入口和主备容灾。

前提条件

已开通 AI DLC 服务并完成服务授权。
已购买资源包,并根据需要创建资源组。
AI DLC 目前为白名单开放,如需使用,请 提交申请

集群构成

计算集群由以下节点角色构成:
头节点:每个集群包含1个头节点组。可选启用高可用,运行主备2个头节点。
工作节点组:每个集群至少包含1个工作节点组。同一节点组内的节点规格相同,支持配置实例数区间。实例数区间的最小值与最大值相同时为固定资源,最小值小于最大值时启用弹性伸缩。

操作步骤

创建计算集群

1. 登录 DLC 控制台,在左侧导航栏选择计算集群
2. 单击新建集群
3. 配置基本信息
参数
是否必填
说明
集群名称
支持中文、英文、数字和下划线,长度不超过64字符。
集群组
支持多选。
优先级
取值范围为1 - 9,默认值为5。
标签
集成腾讯云标签,用于资源分类、权限控制和成本分账。
4. 选择资源包资源组
5. 选择集群镜像。支持选择内置镜像,或填写您在容器镜像服务中的镜像地址。
注意:
构建自定义镜像时,请在 ray 用户下安装依赖。若构建过程中临时切换到 root 用户安装系统依赖,请在安装完成后切回 ray 用户,确保镜像的默认运行用户为 ray,避免运行时出现文件权限问题。
6. 配置计算环境。您可以选择已保存的计算环境模板自动填充节点配置,并在此基础上调整。
头节点参数如下:
参数
说明
节点名称
支持自定义。
单节点资源类型与配额
从 CU 或 GU 规格中选择。
启用高可用
启用后运行主备2个同规格头节点。
环境变量、节点标签与逻辑资源
节点组级的可选配置。
工作节点组参数如下:
参数
说明
节点组名称
同一集群内唯一。
单节点资源类型与配额
从 CU 或 GU 规格中选择。
实例数
配置最小值与最大值,最小值不大于最大值。
环境变量、节点标签与逻辑资源
节点组级的可选配置。
说明:
启用高可用后,主节点异常时备节点自动接管,切换时间通常在30秒内。高可用会使头节点资源占用翻倍,建议在生产推理服务和长时间训练任务中启用,开发调试场景无需启用。
7. 配置存储挂载(可选)。支持挂载 COS、CFS、GooseFS 和 CFS Turbo,可设置子路径、挂载路径和读写权限。挂载配置会被提交到该集群的作业自动继承。
参数
说明
存储卷类型
COS、CFS、GooseFS 或 CFS Turbo。
存储实例
从下拉列表中选择。
子路径配置类型
固定目录,或按实例自动生成独立子目录的动态目录。
子路径与挂载路径
指定存储侧路径与容器内挂载路径。
存储权限
读写或只读,默认为读写。只读适用于共享数据集和模型权重。
8. 配置高级参数(可选)。以键值对形式填写,最多20条。
9. 单击确定完成创建。

管理计算集群

在集群列表的操作列或详情页,您可以执行以下操作:
操作
说明
启动
使集群进入运行状态。已创建、已休眠和异常状态的集群支持启动。
编辑
修改集群配置。运行中、已休眠、已创建和异常状态支持编辑。
克隆
复制现有集群配置创建新集群。所有状态均支持克隆。
休眠
释放计算资源,保留集群配置与存储数据,计算资源不再计费。
删除
释放集群及其关联资源,删除后无法恢复。
说明:
创建中、启动中和休眠中属于过渡状态,此时不支持编辑集群配置。克隆集群时,集群名称需重新填写,其他配置默认沿用源集群并支持修改。

查看集群详情

在集群列表中单击集群名称,进入详情页。详情页包含以下页签:
页签
内容
基本信息
集群标识、名称、集群组、资源组、资源包、创建人、创建时间、镜像、标签、资源配置、存储配置和高级参数。
作业历史
提交到该集群的作业记录,包含作业标识、名称、提交命令、状态、提交时间、运行时长和日志入口。
操作与事件日志
集群层面的系统事件与用户操作记录。
Pod 详情
Pod 名称、IP 地址、角色、状态、所在节点、资源请求与限制、创建时间和配置查看入口。
Dashboard
集群处于运行中状态时,提供 Ray Dashboard 监控视图。

管理集群组

集群组是一组计算集群的逻辑集合。向集群组提交作业时,系统按调度策略从集群组内选择集群运行作业。
一个集群组可绑定多个计算集群,一个集群也可归属多个集群组。
集群组内的成员集群支持跨资源组,因此可实现跨资源组的作业调度。
当前支持随机调度策略。
集群组的典型使用场景如下:
场景
说明
跨资源组错峰
将负载高峰时段不同的集群绑定至同一集群组,实现资源互补。
异构 GPU 统一入口
将不同 GPU 型号的集群按用途分组,用户按用途提交作业,无需选择具体集群。
主备容灾
将主用集群与备用集群绑定至同一集群组,提升服务可用性。
在集群创建页或编辑页单击管理集群组,可创建集群组或修改集群组名称。
注意:
删除集群组时,组内的集群会迁移到您指定的目标集群组,集群本身不受影响。引用被删除集群组的作业配置不会自动更新,再次提交作业时将因目标集群组不存在而失败,请及时修改作业配置。

常见问题

为什么建议先创建集群再提交作业?

按需拉起集群方式下,作业需要先创建头节点和工作节点,通常需要数分钟。使用常驻集群时,作业可快速获取资源,适用于多次提交作业或对启动时延敏感的场景。

工作节点组配置实例数区间后如何触发扩容?

由 Ray 自动伸缩机制根据待调度任务的资源请求触发。扩容时的节点总量不超过资源组的可分配剩余配额。

休眠集群与删除集群有什么区别?

休眠会释放计算资源,保留集群配置与存储数据,后续可再次启动。删除会释放集群及其全部关联资源,且无法恢复。

多个作业提交到同一集群时资源如何分配?

集群的头节点与工作节点由集群上的作业共享,Ray 按任务和 Actor 的资源请求进行调度。每个作业额外占用一个轻量的作业驱动进程,不计入资源配额。