功能说明
权重路由按照配置的权重比例将流量分配到多个模型服务。这种路由策略适用于以下场景:
负载均衡:为同一模型的多个实例分配流量,避免单点过载
A/B 测试:按比例测试不同供应商或模型版本的效果
灰度发布:小流量验证新服务,逐步放大流量比例
成本优化:将大部分流量导向成本更低的服务,保留少量高质量服务作为补充
配置步骤
步骤1:在模型 API 中配置权重路由
1. 登录微服务平台控制台,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 在左侧导航栏单击模型管理 > 模型 API;
4. 单击新建或编辑已有 API;
5. 完成基本信息配置后,在第二步:选择模型服务与路由策略页面;
6. 选择路由策略为权重路由;
7. 为每个模型服务配置权重。
配置参数:
参数 | 说明 | 示例 | 约束 |
模型服务 | 从已创建的模型服务列表中选择 | qwen-plus-aliyun | - |
权重 | 该服务的流量权重,范围1-100 | 70 | 必填,整数 |
流量占比 | 自动计算的流量百分比 | 70% | 只读 |
步骤2:保存并发布
配置完成后,单击 确定 保存配置。权重路由策略会立即生效。
权重分配逻辑
权重总和不限制:
权重总和不要求等于100,网关会自动按比例计算:
服务A权重50,服务B权重30:- 服务A流量占比 = 50 / (50+30) = 62.5%- 服务B流量占比 = 30 / (50+30) = 37.5%
动态调整权重:
您可以随时编辑模型 API,调整权重配置,变更会在保存后立即生效(无需重启服务)。
典型场景示例
场景1:负载均衡 - 多实例部署
需求:自建了3个 vLLM 实例,希望均匀分配流量
配置:
模型服务 | 权重 | 流量占比 |
vllm-instance-1 | 33 | 33% |
vllm-instance-2 | 33 | 33% |
vllm-instance-3 | 34 | 34% |
效果:每个实例接收约1/3的流量,实现负载均衡。
场景2:A/B 测试 - 新旧服务对比
需求:测试新部署的 qwen-max-2.5模型,与现有 qwen-max 对比效果
配置:
模型服务 | 权重 | 流量占比 | 说明 |
qwen-max(旧版本) | 80 | 80% | 主流量 |
qwen-max-2.5(新版本) | 20 | 20% | 测试流量 |
效果:20%流量路由到新版本,收集效果数据后决定是否全量切换。
场景3:灰度发布 - 逐步放量
需求:新模型服务需要灰度发布,从5%流量逐步放大到100%
阶段1:初始灰度(5%流量)
模型服务 | 权重 |
旧服务 | 95 |
新服务 | 5 |
阶段2:扩大灰度(30%流量)
模型服务 | 权重 |
旧服务 | 70 |
新服务 | 30 |
阶段3:全量切换(100%流量)
模型服务 | 权重 |
新服务 | 100 |
删除旧服务或权重设为0
场景4:成本优化 - 混合供应商
需求:大部分流量使用成本较低的国产模型,保留少量 Open AI 服务作为备份
配置:
模型服务 | 权重 | 流量占比 | 成本 |
qwen-max-aliyun | 85 | 85% | 低 |
gpt-4o-openai | 15 | 15% | 高 |
效果:85%流量使用成本更低的 qwen-max,15%流量使用 gpt-4o 保障质量。