帮你快速理解、总结文档立即下载

权重路由

最近更新时间:2026-06-11 20:38:32

我的收藏

功能说明

权重路由按照配置的权重比例将流量分配到多个模型服务。这种路由策略适用于以下场景:
负载均衡:为同一模型的多个实例分配流量,避免单点过载
A/B 测试:按比例测试不同供应商或模型版本的效果
灰度发布:小流量验证新服务,逐步放大流量比例
成本优化:将大部分流量导向成本更低的服务,保留少量高质量服务作为补充

配置步骤

步骤1:在模型 API 中配置权重路由

1. 登录微服务平台控制台,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 在左侧导航栏单击模型管理 > 模型 API;
4. 单击新建或编辑已有 API;
5. 完成基本信息配置后,在第二步:选择模型服务与路由策略页面;
6. 选择路由策略为权重路由;
7. 为每个模型服务配置权重。
配置参数
参数
说明
示例
约束
模型服务
从已创建的模型服务列表中选择
qwen-plus-aliyun
-
权重
该服务的流量权重,范围1-100
70
必填,整数
流量占比
自动计算的流量百分比
70%
只读

步骤2:保存并发布

配置完成后,单击 确定 保存配置。权重路由策略会立即生效。

权重分配逻辑

权重总和不限制
权重总和不要求等于100,网关会自动按比例计算:
服务A权重50,服务B权重30:
- 服务A流量占比 = 50 / (50+30) = 62.5%
- 服务B流量占比 = 30 / (50+30) = 37.5%
动态调整权重
您可以随时编辑模型 API,调整权重配置,变更会在保存后立即生效(无需重启服务)。

典型场景示例

场景1:负载均衡 - 多实例部署

需求:自建了3个 vLLM 实例,希望均匀分配流量
配置
模型服务
权重
流量占比
vllm-instance-1
33
33%
vllm-instance-2
33
33%
vllm-instance-3
34
34%
效果:每个实例接收约1/3的流量,实现负载均衡。

场景2:A/B 测试 - 新旧服务对比

需求:测试新部署的 qwen-max-2.5模型,与现有 qwen-max 对比效果
配置
模型服务
权重
流量占比
说明
qwen-max(旧版本)
80
80%
主流量
qwen-max-2.5(新版本)
20
20%
测试流量
效果:20%流量路由到新版本,收集效果数据后决定是否全量切换。

场景3:灰度发布 - 逐步放量

需求:新模型服务需要灰度发布,从5%流量逐步放大到100%
阶段1:初始灰度(5%流量)
模型服务
权重
旧服务
95
新服务
5
阶段2:扩大灰度(30%流量)
模型服务
权重
旧服务
70
新服务
30
阶段3:全量切换(100%流量)
模型服务
权重
新服务
100
删除旧服务或权重设为0

场景4:成本优化 - 混合供应商

需求:大部分流量使用成本较低的国产模型,保留少量 Open AI 服务作为备份
配置
模型服务
权重
流量占比
成本
qwen-max-aliyun
85
85%
gpt-4o-openai
15
15%
效果:85%流量使用成本更低的 qwen-max,15%流量使用 gpt-4o 保障质量。