帮你快速理解、总结文档立即下载

配额感知降级

最近更新时间:2026-06-25 11:38:25

我的收藏

操作场景

配额感知降级在模型 API 级别配置,当模型服务配额或请求配额即将耗尽时,自动将请求降级到备用服务,防止因配额不足导致请求失败。适用于以下场景:
成本控制:当高成本模型服务的配额即将用尽时,自动降级到低成本备用服务,避免超预算。
预算管理:按月度/季度预算控制模型调用量,防止超支。
说明:
配额感知降级是全局跨服务 Fallback 的增强特性,需在模型 API 的 Fallback 配置中开启。

前置条件

1. 已创建 AI 网关实例且处于运行中状态;
2. 已配置模型服务,并已为其分配配额;
3. 已创建至少两个模型服务(主服务和备用服务);
4. 已开启全局跨服务 Fallback 并配置备用服务链。

操作步骤

模型 API 中配置配额感知降级

步骤 1:进入模型服务配置页

1. 登录 微服务平台控制台 ,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 在左侧导航栏单击模型管理,然后单击模型服务页签;
4. 单击新建,进入新建模型服务页面;
5. 在基本信息配置中,展开高级配置,进行模型服务的配额配置,支持配置 RPM(每分钟请求数)和 TPM(每分钟 Token 数)

步骤 2:进入模型 API 配置页

1. 登录 微服务平台控制台 ,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 在左侧导航栏单击 模型管理,然后单击模型 API 页签;
4. 单击新建或编辑已有 API;
5. 完成基本信息配置后,进入 第二步:选择模型服务。

步骤 3:开启全局跨服务 Fallback

1. 全局跨服务 Fallback 区域,开启 全局跨服务 Fallback 开关
2. 配置备用服务链


步骤 4:配置配额不足触发条件

配额不足 触发条件启用后,需要配置具体的配额阈值:

配置参数说明
参数
是否必填
说明
配额阈值
剩余配额低于此百分比时触发降级,默认 10%,建议10%-20%
检查维度
支持两种:
推荐策略:模型服务的 RPM 或 TPM 任一不足即触发
严格策略:模型服务的 RPM 和 TPM 同时不足才触发
配额阈值建议值
阈值
说明
适用场景
5%
激进的降级触发时机,尽可能用完配额
成本敏感场景,希望最大化利用已购配额
10%
推荐的降级触发时机
大多数场景的推荐值
20%
保守的降级触发时机,提前准备
高可用优先场景,需要预留缓冲
50%
非常保守的降级触发时机
关键业务,配额充足时即开始降级

步骤 5:保存配置

单击确定 保存模型 API 配置,配额感知降级规则立即生效。

查看 Fallback 记录

在模型 API 详情页的 Fallback 记录 Tab 中,可以查看所有 Fallback 事件,包括配额感知降级触发的记录。

注意事项

1. 配额预配置:配额感知降级依赖消费者或 API 的配额配置。如果未配置配额,配额感知降级不会触发。
2. 阈值设定:建议将配额阈值设置为 5%-20%,过低可能导致大量请求因配额用尽而失败,过高则可能太早切换到备用服务。
3. 降级与限流的区别
限流:超出配额直接拒绝请求(返回 429)。
配额感知降级:配额即将用尽时,将请求迁移到备用服务(返回正常响应)。
4. 双重降级组合:配额感知降级可以与服务不可用、连接超时等触发条件组合使用,实现更完整的降级策略。
5. 成本控制:配额感知降级特别适合成本敏感场景,可在高成本服务配额用尽时自动切换到低成本服务,避免超预算。