帮你快速理解、总结文档立即下载

缓存策略

最近更新时间:2026-06-11 20:38:32

我的收藏

操作场景

AI 缓存能力基于双层缓存架构(精确缓存 L1 + 语义缓存 L2),帮助企业降低 LLM 调用成本、提升响应速度。适用于以下场景:
降低成本:命中缓存的请求不调用 LLM,节省全部 Token 费用,典型场景可节省 30%~60%。
提升速度:精确缓存命中延迟 < 2ms,语义缓存命中延迟 < 200ms,相比 LLM 推理(1-10 秒)大幅提升。
语义匹配:语义相似但措辞不同的请求可命中缓存,突破传统精确匹配局限。
双层架构:先精确后语义的两阶段查询,兼顾速度与命中率。

前置条件

精确缓存前置条件

1. 已创建 AI 网关实例,已创建模型 API 并配置至少一个路由;
2. 已配置 Redis 服务来源;
3. Redis 实例可正常访问。

语义缓存前置条件(额外)

已有向量数据库 VDB,并且在向量数据库中创建数据库和 Collection,要求:
索引类型:HNSW
相似性方法:COSINE(必须)
内置 Embedding:已开启并选择模型(如 bge-base-zh
索引状态:ready

操作步骤

配置缓存

精确缓存基于 Redis 存储,对完全相同的 LLM 请求返回缓存响应,跳过 LLM 调用。语义缓存基于向量相似度匹配,对语义相似但措辞不同的请求返回缓存响应。

步骤 1:进入模型 API 缓存策略页

1. 登录 微服务平台控制台 ,在左侧导航栏单击云原生智能网关 > 实例列表;
2. 在实例列表页面,单击需要配置的网关实例的“ID”,进入该网关实例的基本信息页面;
3. 选择左侧导航栏 模型管理 > 模型 API;
4. 单击目标模型 API 名称,进入详情页;
5. 单击 缓存策略 Tab,在 缓存策略 Tab 中,查看当前缓存配置状态。如果尚未配置,显示 未配置;
6. 单击 配置缓存策略,进入缓存配置对话框。

步骤 2:配置精确缓存

勾选 精确缓存 后,配置以下参数:
配置参数说明
参数
是否必填
说明
推荐值
缓存键策略
缓存匹配范围
单轮问答选"最新用户消息",多轮对话选"历史对话模式"
TTL(秒)
缓存有效期,范围 60-604800
3600(1小时)

步骤 3:配置语义缓存(可选)

在缓存配置对话框中,勾选 语义缓存
配置参数说明
参数
是否必填
说明
推荐值
VDB 服务来源
选择已配置的腾讯云 VDB 服务来源
同地域 VDB 实例
相似度阈值
范围 0.50-0.99,高于此值视为命中
0.85
最大 Token 距离
请求 Token 总数超过此值时不使用语义缓存
500
数据库
VDB 实例下的数据库,系统自动拉取列表
集合
数据库下的集合,系统自动拉取并校验
高级配置:
参数
说明
按用户隔离缓存
默认关闭,不同用户的相同请求会生成独立缓存,提高隐私性
仅缓存成功响应
默认开启,只缓存 200 状态码的成功响应,错误请求不缓存
返回缓存标识
默认关闭,在响应 Header 中添加 X-Cache: HIT/MISS 标识

步骤 4:保存缓存配置

单击 确定 保存配置,缓存立即生效。

查看缓存策略列表

在左侧导航栏选择 成本管理 > AI 缓存配置,可查看缓存策略列表

查看缓存命中统计

成本管理 > AI 缓存命中统计 页面,可查看缓存命中率、节省成本等可观测指标,评估缓存效果。

步骤 1:进入 AI 缓存命中统计页面

2. 在左侧导航栏选择 成本管理 > AI 缓存命中统计

步骤 2:配置筛选条件

筛选条件
说明
选项
消费者组
按消费者组筛选(可选全部)
全部 / 指定消费者组
模型 API
按模型 API 筛选(可选全部)
全部 / 指定模型 API
时间范围
选择数据展示的时间窗口
今天/ 本周/ 本月/ 近7天/ 近30天/ 自定义

步骤 3:查看核心指标卡片

快速查看缓存命中的核心指标:
指标
说明
总请求次数
选定时间范围内网关收到的 LLM 请求总数
精确命中次数
L1 精确缓存命中次数,显示实际命中数和占比
语义命中次数
L2 语义缓存命中次数,显示实际命中数和占比
网关缓存命中率
(精确命中 + 语义命中)/ 总请求数 × 100%
网关缓存节省
命中请求未调用 LLM 节省的估算费用(基于模型单价计算)

步骤 4:查看语义缓存相似度分布

展示语义缓存命中的相似度分数分布,帮助评估语义缓存阈值设置的合理性:
相似度分布分析
相似度区间
说明
0.9 - 1.0
高相似度命中,表示用户请求与缓存内容非常接近
0.8 - 0.9
中等相似度命中,表示语义相似但措辞不同的请求
0.7 - 0.8
较低相似度命中,需要关注是否出现错误匹配
0.6 - 0.7
低相似度命中,建议检查是否误判
0 - 0.6
极低相似度命中,可能存在误匹配风险
调优参考:
如果大量命中集中在 0.8 以下区间(占比 > 30%),建议适当提高相似度阈值;如果 0.9 以上区间的命中数量过低(占比 < 20%),建议适当降低阈值以提高命中率。

步骤 5:查看缓存命中趋势与分布

趋势与分布面板说明:
面板名称
说明
缓存命中率趋势
展示选定时间范围内的缓存命中率变化趋势(按小时/天粒度)
缓存类型分布
饼图展示精确缓存与语义缓存的命中比例
响应时间对比
对比缓存命中请求与未命中请求的平均响应时间,展示提升倍率

步骤 6:查看缓存命中明细

缓存命中明细表格展示按模型 API 和按消费者的详细命中数据。
列名
说明
消费者组
请求所属的消费者组
缓存命中数
缓存命中(精确 + 语义)的请求数量
缓存未命中数
未命中缓存、直接调用 LLM 的请求数量
命中率
缓存命中数 /(命中数 + 未命中数)× 100%
节省成本
缓存命中节省的估算费用(¥)
节省 Token
缓存命中节省的估算 Token 数
命中平均响应时间
缓存命中请求的平均响应时间(ms)
未命中平均响应时间
未命中请求的平均响应时间(ms)
提升倍率
未命中平均响应时间 / 命中平均响应时间

步骤 7:导出统计报表

在缓存命中统计页面,可单击 导出 CSV 按钮,下载当前筛选条件下的明细数据。