实践背景
订单系统、大数据集群和不同地域节点可能分布在多朵云上,每朵云都有自己的控制台、指标口径和资源清单。人工巡检通常要逐个查看告警和资源曲线,再手动汇总。这样不仅耗时,还容易遗漏长期低负载、持续高负载或配置异常的资源。
把不同云的监控数据接入 AI 工作台后,可以用同一句话完成统一巡检:对腾讯云和阿里云的云服务器和数据库资源做一个整体的健康巡检。
实践内容
多云统一的不是“大盘”,而是口径
真正需要统一的是业务对象、时间窗口、指标口径、证据格式和结论口径:
需要统一的内容 | 用户得到的价值 |
业务对象 | 按订单系统、大数据集群理解资源,而不是记忆各云实例 ID |
时间窗口 | 所有云围绕同一时段巡检,结果可比较 |
指标口径 | 同一个利用率指标采用一致的判断标准 |
证据格式 | 告警、指标和资源状态统一呈现 |
结论口径 | 统一输出严重程度、影响范围和建议动作 |
一次巡检跑三件事
确定巡检范围,使用腾讯云 Skill 和第三方云 Skill 查询各云资源,AI 汇总分析。AI 的动作顺序是:
1. 确认巡检范围和各云对应的 Skill。
2. 按统一时间窗口拉取告警、指标和资源状态。
3. 输出分级健康清单。
4. 对比各类资源的利用率,识别低负载和高负载对象。
5. 汇总疑似闲置、超配或可合并资源。
这里的成本优化不是账单分析。当前能力边界内,AI 根据资源状态和利用率曲线识别浪费信号,给出优先处理方向和判断依据;具体节省金额、规格价格和账单核算仍由人工完成。
分析结果
这次巡检覆盖腾讯云与阿里云的云服务器、数据库资源,由
tcop-inspecting 与 alibabacloud-cms-manage 协同完成。结果集中在三件事:5个资源中1个需重点关注、CDB 内存持续高负载、1台新建 ECS 疑似低负载。报告模块 | 报告内容 |
总览摘要 | AI 工作台统一汇总巡检结果。 ![]() |
分级健康情况 | 5个资源中1个需重点关注。 ![]() |
详细利用率数据 | CDB 内存持续高负载,1台新建 ECS 疑似低负载。 ![]() |
闲置资源识别与处置建议 | 输出资源状态和调整方向。 ![]() |
小结
类别 | 逐云控制台人工巡检 | AI 工作台统一巡检 |
发起方式 | 打开多个控制台,逐个查看 | 一句话覆盖资源地图内的资源 |
口径 | 各云一套,靠人换算 | 统一时间窗和指标口径 |
覆盖范围 | 依赖人工记忆 | 按资源地图统一覆盖 |
产出形态 | 截图和表格,结论靠人写 | 分级清单 + 证据 + 建议动作 |
多云管理的重点,不是把所有云做成一张大盘,而是让不同云上的资源可以用同一套问题入口来巡检和分析。
配置指引
配置 Skill 到数字分身
扩展中心的广场提供可直接配置到数字分身的预设 Skill,适用于扩展跨云和特定场景的运维能力。
1. 进入 AI 工作台 > 扩展中心 > Skill 技能 页面,选择广场,查看可用 Skill。

2. 查看预设的 alibabacloud-cms-manage ,可处理阿里云 CloudMonitor/CMS 的告警、指标、云资源、APM、RUM、Prometheus、SLS 等相关查询和管理任务。
3. 进入 AI 工作台 > 数字分身管理 页面,创建或编辑目标数字分身,在分身配置中添加 alibabacloud-cms-manage Skill。
4. 完成分身配置后,进入目标分身的分身详情 > 集成配置,按照页面指引添加阿里云授权环境变量。
环境变量 | 说明 |
ALIBABA_CLOUD_ACCESS_KEY_ID | 阿里云 RAM 用户的 AccessKey ID。 |
ALIBABA_CLOUD_ACCESS_KEY_SECRET | 阿里云 RAM 用户的 AccessKey Secret。 |
ALIBABA_CLOUD_REGION | 阿里云资源所在地域,例如 cn-hangzhou。 |
注意:
请使用具备所需最小权限的阿里云 RAM 凭据,并将 AccessKey ID 和 AccessKey Secret 按敏感信息管理。不要在 Skill 描述、任务内容或对话中填写凭据。
发起多云会话
1. 选择需要使用的多云 Skill。
阿里云 Skill:alibabacloud-cms-manage
腾讯云巡检 Skill:tcop-inspecting
2. 输入问题,建议包括明确的资源种类、范围和查询问题。
3. 查看分析过程的工具调用和会话结果。



