帮你快速理解、总结文档立即下载

多云管理实践教程

最近更新时间:2026-10-09 14:19:31
我的收藏

实践背景

订单系统、大数据集群和不同地域节点可能分布在多朵云上,每朵云都有自己的控制台、指标口径和资源清单。人工巡检通常要逐个查看告警和资源曲线,再手动汇总。这样不仅耗时,还容易遗漏长期低负载、持续高负载或配置异常的资源。
把不同云的监控数据接入 AI 工作台后,可以用同一句话完成统一巡检:对腾讯云和阿里云的云服务器和数据库资源做一个整体的健康巡检。

实践内容

多云统一的不是“大盘”,而是口径

真正需要统一的是业务对象、时间窗口、指标口径、证据格式和结论口径:
需要统一的内容
用户得到的价值
业务对象
按订单系统、大数据集群理解资源,而不是记忆各云实例 ID
时间窗口
所有云围绕同一时段巡检,结果可比较
指标口径
同一个利用率指标采用一致的判断标准
证据格式
告警、指标和资源状态统一呈现
结论口径
统一输出严重程度、影响范围和建议动作

一次巡检跑三件事

确定巡检范围,使用腾讯云 Skill 和第三方云 Skill 查询各云资源,AI 汇总分析。AI 的动作顺序是:
1. 确认巡检范围和各云对应的 Skill。
2. 按统一时间窗口拉取告警、指标和资源状态。
3. 输出分级健康清单。
4. 对比各类资源的利用率,识别低负载和高负载对象。
5. 汇总疑似闲置、超配或可合并资源。
这里的成本优化不是账单分析。当前能力边界内,AI 根据资源状态和利用率曲线识别浪费信号,给出优先处理方向和判断依据;具体节省金额、规格价格和账单核算仍由人工完成。

分析结果

这次巡检覆盖腾讯云与阿里云的云服务器、数据库资源,由 tcop-inspecting 与 alibabacloud-cms-manage 协同完成。结果集中在三件事:5个资源中1个需重点关注、CDB 内存持续高负载、1台新建 ECS 疑似低负载。
报告模块
报告内容
总览摘要
AI 工作台统一汇总巡检结果。

分级健康情况
5个资源中1个需重点关注。

详细利用率数据
CDB 内存持续高负载,1台新建 ECS 疑似低负载。

闲置资源识别与处置建议
输出资源状态和调整方向。


小结

类别
逐云控制台人工巡检
AI 工作台统一巡检
发起方式
打开多个控制台,逐个查看
一句话覆盖资源地图内的资源
口径
各云一套,靠人换算
统一时间窗和指标口径
覆盖范围
依赖人工记忆
按资源地图统一覆盖
产出形态
截图和表格,结论靠人写
分级清单 + 证据 + 建议动作
多云管理的重点,不是把所有云做成一张大盘,而是让不同云上的资源可以用同一套问题入口来巡检和分析。

配置指引

配置 Skill 到数字分身

扩展中心的广场提供可直接配置到数字分身的预设 Skill,适用于扩展跨云和特定场景的运维能力。
1. 进入 AI 工作台 > 扩展中心 > Skill 技能 页面,选择广场,查看可用 Skill。

2. 查看预设的 alibabacloud-cms-manage ,可处理阿里云 CloudMonitor/CMS 的告警、指标、云资源、APM、RUM、Prometheus、SLS 等相关查询和管理任务。
3. 进入 AI 工作台 > 数字分身管理 页面,创建或编辑目标数字分身,在分身配置中添加 alibabacloud-cms-manage Skill。
4. 完成分身配置后,进入目标分身的分身详情 > 集成配置,按照页面指引添加阿里云授权环境变量。
环境变量
说明
ALIBABA_CLOUD_ACCESS_KEY_ID
阿里云 RAM 用户的 AccessKey ID。
ALIBABA_CLOUD_ACCESS_KEY_SECRET
阿里云 RAM 用户的 AccessKey Secret。
ALIBABA_CLOUD_REGION
阿里云资源所在地域,例如 cn-hangzhou。
注意:
请使用具备所需最小权限的阿里云 RAM 凭据,并将 AccessKey ID 和 AccessKey Secret 按敏感信息管理。不要在 Skill 描述、任务内容或对话中填写凭据。

发起多云会话

在左侧导航栏选择 AI 工作台 > 工作面板,在页面顶部选择目标数字分身,切换至会话列表页签,新建会话。
1. 选择需要使用的多云 Skill。
阿里云 Skill:alibabacloud-cms-manage
腾讯云巡检 Skill:tcop-inspecting
2. 输入问题,建议包括明确的资源种类、范围和查询问题。
3. 查看分析过程的工具调用和会话结果。