操作场景
配额感知降级在模型 API 级别配置,当模型服务配额或请求配额即将耗尽时,自动将请求降级到备用服务,防止因配额不足导致请求失败。适用于以下场景:
成本控制:当高成本模型服务的配额即将用尽时,自动降级到低成本备用服务,避免超预算。
预算管理:按月度/季度预算控制模型调用量,防止超支。
说明:
配额感知降级是全局跨服务 Fallback 的增强特性,需在模型 API 的 Fallback 配置中开启。
前置条件
1. 已创建 AI 网关实例且处于运行中状态;
2. 已配置模型服务,并已为其分配配额;
3. 已创建至少两个模型服务(主服务和备用服务);
4. 已开启全局跨服务 Fallback 并配置备用服务链。
操作步骤
模型 API 中配置配额感知降级
步骤 1:进入模型服务配置页
1. 登录 微服务平台控制台 ,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 在左侧导航栏单击模型管理,然后单击模型服务页签;
4. 单击新建,进入新建模型服务页面;
5. 在基本信息配置中,展开高级配置,进行模型服务的配额配置,支持配置 RPM(每分钟请求数)和 TPM(每分钟 Token 数)。
步骤 2:进入模型 API 配置页
1. 登录 微服务平台控制台 ,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 在左侧导航栏单击 模型管理,然后单击模型 API 页签;
4. 单击新建或编辑已有 API;
5. 完成基本信息配置后,进入 第二步:选择模型服务。
步骤 3:开启全局跨服务 Fallback
1. 在 全局跨服务 Fallback 区域,开启 全局跨服务 Fallback 开关
2. 配置备用服务链

步骤 4:配置配额不足触发条件
当 配额不足 触发条件启用后,需要配置具体的配额阈值:
配置参数说明:
参数 | 是否必填 | 说明 |
配额阈值 | 是 | 剩余配额低于此百分比时触发降级,默认 10%,建议10%-20% |
检查维度 | 是 | 支持两种: 推荐策略:模型服务的 RPM 或 TPM 任一不足即触发 严格策略:模型服务的 RPM 和 TPM 同时不足才触发 |
配额阈值建议值:
阈值 | 说明 | 适用场景 |
5% | 激进的降级触发时机,尽可能用完配额 | 成本敏感场景,希望最大化利用已购配额 |
10% | 推荐的降级触发时机 | 大多数场景的推荐值 |
20% | 保守的降级触发时机,提前准备 | 高可用优先场景,需要预留缓冲 |
50% | 非常保守的降级触发时机 | 关键业务,配额充足时即开始降级 |
步骤 5:保存配置
单击确定 保存模型 API 配置,配额感知降级规则立即生效。
查看 Fallback 记录
在模型 API 详情页的 Fallback 记录 Tab 中,可以查看所有 Fallback 事件,包括配额感知降级触发的记录。
注意事项
1. 配额预配置:配额感知降级依赖消费者或 API 的配额配置。如果未配置配额,配额感知降级不会触发。
2. 阈值设定:建议将配额阈值设置为 5%-20%,过低可能导致大量请求因配额用尽而失败,过高则可能太早切换到备用服务。
3. 降级与限流的区别:
限流:超出配额直接拒绝请求(返回 429)。
配额感知降级:配额即将用尽时,将请求迁移到备用服务(返回正常响应)。
4. 双重降级组合:配额感知降级可以与服务不可用、连接超时等触发条件组合使用,实现更完整的降级策略。
5. 成本控制:配额感知降级特别适合成本敏感场景,可在高成本服务配额用尽时自动切换到低成本服务,避免超预算。