操作场景
延迟优先智能路由策略根据模型服务的实时延迟情况,自动优先路由到延迟较低的模型服务。适用于以下场景:
跨地域多线路选路:多 IDC、多云专线场景下,根据网络延迟选择最优线路。
端到端响应体验优化:多个模型后端性能差异显著,优先选择响应快的后端。
容量充足场景:第三方 API 等容量充足服务,追求最低延迟。
容量受限场景:自建集群或混合场景,需要均衡负载与延迟。
前置条件
1. 已创建 AI 网关实例且处于运行中状态;
2. 已创建多个模型服务,且服务间存在延迟差异;
3. 了解各模型服务的网络延迟和性能特征。
操作步骤
步骤 1:进入模型 API 配置页
1. 登录微服务平台控制台,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 选择左侧导航栏 模型管理 > 模型 API;
4. 单击新建或编辑已有 API;
5. 完成基本信息配置后,进入 第二步:选择模型服务。
步骤 2:选择服务类型和路由策略
1. 选择服务类型为多模型服务;
2. 在路由策略区域,选择延迟优先路由。
步骤 3:选择延迟场景
在延迟场景区域,选择适合的延迟场景
网络延迟最优 适用于跨地域多线路选路场景,优先选择网络链路质量最好的服务。包括以下场景:
跨地域多线路:多个 IDC、多云专线场景,需要选择网络最优路径
机房直连线路:后端服务本身性能相近,差异主要来自网络延迟
关注链路质量:业务对网络延迟敏感,对模型业务属性无特殊要求
1. 在 目标模型服务 区域,单击 请选择服务 下拉框;
2. 选择需要参与延迟优先路由的模型服务(可多选);
3. 系统将自动监测这些服务的网络延迟,并优先路由到延迟最低的服务。
模型延迟最优适用于端到端响应体验优化场景,综合考虑后端模型服务的处理延迟。包括以下场景:
后端性能差异显著:不同模型服务(如不同供应商、不同规格)的处理速度差异大 。
关注端到端体验:业务对整体响应时间敏感,需要优化用户体验。
负载影响延迟:自建集群场景,后端负载会直接影响响应延迟。
根据服务容量特征,选择合适的路由策略:
路由策略 | 说明 | 适用场景 |
快速策略 | 始终选择延迟最低的服务,不考虑负载均衡 | 第三方 API 等容量充足、延迟稳定的服务 |
均衡策略 | 在延迟和负载间均衡,避免单点过载 | 自建集群或混合场景,容量有限 |
步骤 4:配置目标模型服务
1. 在 目标模型服务 区域,单击 请选择服务 下拉框;
2. 选择需要参与延迟优先路由的模型服务(可多选);
3. 系统将自动监测这些服务的网络延迟,并优先路由到延迟最低的服务。
步骤 5:保存配置
单击确定保存模型 API 配置,延迟优先路由立即生效。
注意事项
1. 网络延迟监测机制:网关通过周期性探测监测各服务的延迟,实际路由决策基于最近一次的探测数据。
2. 网络延迟数据时效性:延迟数据存在一定的更新滞后,不适合应对秒级的网络抖动。
3. 快速策略的容量风险:使用快速策略时,所有流量可能集中到延迟最低的服务,需确保该服务容量充足。
4. 均衡策略的延迟权衡:均衡策略会牺牲部分延迟性能换取负载均衡,适用于对延迟要求不高的场景。
5. 与 Fallback 的配合:延迟优先路由可与全局跨服务 Fallback 配合使用,当延迟最低的服务不可用时自动切换到备用服务。