帮你快速理解、总结文档立即下载

延迟优先路由

最近更新时间:2026-06-11 20:38:32

我的收藏

操作场景

延迟优先智能路由策略根据模型服务的实时延迟情况,自动优先路由到延迟较低的模型服务。适用于以下场景:
跨地域多线路选路:多 IDC、多云专线场景下,根据网络延迟选择最优线路。
端到端响应体验优化:多个模型后端性能差异显著,优先选择响应快的后端。
容量充足场景:第三方 API 等容量充足服务,追求最低延迟。
容量受限场景:自建集群或混合场景,需要均衡负载与延迟。

前置条件

1. 已创建 AI 网关实例且处于运行中状态;
2. 已创建多个模型服务,且服务间存在延迟差异;
3. 了解各模型服务的网络延迟和性能特征。

操作步骤

步骤 1:进入模型 API 配置页

1. 登录微服务平台控制台,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 选择左侧导航栏 模型管理 > 模型 API;
4. 单击新建或编辑已有 API;
5. 完成基本信息配置后,进入 第二步:选择模型服务。

步骤 2:选择服务类型和路由策略

1. 选择服务类型多模型服务;
2. 路由策略区域,选择延迟优先路由。

步骤 3:选择延迟场景

延迟场景区域,选择适合的延迟场景
场景一:网络延迟最优
场景二:模型延迟最优
网络延迟最优 适用于跨地域多线路选路场景,优先选择网络链路质量最好的服务。包括以下场景:
跨地域多线路:多个 IDC、多云专线场景,需要选择网络最优路径
机房直连线路:后端服务本身性能相近,差异主要来自网络延迟
关注链路质量:业务对网络延迟敏感,对模型业务属性无特殊要求

1. 目标模型服务 区域,单击 请选择服务 下拉框;
2. 选择需要参与延迟优先路由的模型服务(可多选);
3. 系统将自动监测这些服务的网络延迟,并优先路由到延迟最低的服务。
模型延迟最优适用于端到端响应体验优化场景,综合考虑后端模型服务的处理延迟。包括以下场景:
后端性能差异显著:不同模型服务(如不同供应商、不同规格)的处理速度差异大 。
关注端到端体验:业务对整体响应时间敏感,需要优化用户体验。
负载影响延迟:自建集群场景,后端负载会直接影响响应延迟。

根据服务容量特征,选择合适的路由策略:
路由策略
说明
适用场景
快速策略
始终选择延迟最低的服务,不考虑负载均衡
第三方 API 等容量充足、延迟稳定的服务
均衡策略
在延迟和负载间均衡,避免单点过载
自建集群或混合场景,容量有限

步骤 4:配置目标模型服务

1. 目标模型服务 区域,单击 请选择服务 下拉框;
2. 选择需要参与延迟优先路由的模型服务(可多选);
3. 系统将自动监测这些服务的网络延迟,并优先路由到延迟最低的服务。

步骤 5:保存配置

单击确定保存模型 API 配置,延迟优先路由立即生效。

注意事项

1. 网络延迟监测机制:网关通过周期性探测监测各服务的延迟,实际路由决策基于最近一次的探测数据。
2. 网络延迟数据时效性:延迟数据存在一定的更新滞后,不适合应对秒级的网络抖动。
3. 快速策略的容量风险:使用快速策略时,所有流量可能集中到延迟最低的服务,需确保该服务容量充足。
4. 均衡策略的延迟权衡:均衡策略会牺牲部分延迟性能换取负载均衡,适用于对延迟要求不高的场景。
5. 与 Fallback 的配合:延迟优先路由可与全局跨服务 Fallback 配合使用,当延迟最低的服务不可用时自动切换到备用服务。