操作场景
AI 网关对接腾讯云日志服务(CLS),提供基于日志大盘的 LLM 和 MCP 监控可视化能力。通过 CLS 日志大盘,您可以使用如下能力:
全局概览:查看网关层面的核心指标,包括总请求数、延迟分位、错误率、Token 消耗量、首 Token 延迟等
LLM 监控:深入分析大模型调用的性能指标,包括 Token 消耗趋势、Provider 响应时间、Prompt 长度分布等
MCP 监控:监控 MCP 工具调用的成功率、延迟和调用趋势
说明:
日志大盘的数据来源于已投递到 CLS 的 AI 网关访问日志。使用前请确保已在 数据观测 > 日志投递 中开启了 LLM 访问日志和 MCP 访问日志投递。
前置条件
1. 已创建 AI 网关实例且处于运行中状态
2. 已在 数据观测 > 日志投递 中配置并开启了 CLS 日志投递(日志主题已创建且数据正常写入)
3. 网关已有 LLM 或 MCP 请求流量(新开启投递后约 1-2 分钟开始产生数据)
查看日志大盘
1. 登录微服务平台控制台 ,在左侧导航栏单击云原生智能网关 > 实例列表。
2. 在实例列表中,单击目标实例名称进入实例详情页
3. 在左侧导航栏选择数据观测,单击日志大盘 Tab
日志大盘页面包含三个子 Tab:
Tab | 说明 | 适用场景 |
全局概览 | 展示网关层面的聚合指标和 Top 榜单 | 快速了解网关整体运行状态 |
LLM 监控 | 展示大模型调用的专项指标 | 分析 LLM 请求的性能和消耗 |
MCP 监控 | 展示 MCP 工具调用的专项指标 | 监控 MCP Server 和 Tool 的健康状态 |
使用场景
场景一:全局概览
全局概览提供网关层面的核心指标聚合,帮助您快速掌握整体运行状态。
说明:
目前全局概览仅包括 LLM 调用相关指标,暂未统计 MCP 与 Agent 调用指标。
1. 核心指标卡片
指标卡片 | 说明 |
总请求数 | 选定时间范围内的网关请求总数 |
平均请求延迟 P95 | 端到端请求延迟的 95 分位值(ms) |
请求最大延迟 P99 | 端到端请求延迟的 99 分位值(ms) |
错误率(%) | 失败请求占总请求的比例(HTTP ≥ 400) |
Token 消耗量 | 输入 + 输出 Token 的总消耗量 |
首 Token 延迟 TTFT P95 | 流式响应首 Token 时间的 95 分位值(ms) |
2. 查看异常快速发现
异常快速发现(消费者风险 Top 10) 面板展示高风险消费者的排名:
基于错误率、延迟、Token 消耗等维度综合评估消费者风险综合计算的异常评分。
帮助您快速定位问题消费者,及时排查异常
3. 查看分布与趋势面板
面板名称 | 说明 |
请求量趋势(QPS) | 展示每秒请求数的变化趋势 |
错误率趋势(%) | 展示错误率随时间的变化趋势 |
端到端延迟分布 P50/P95/P99 | 展示请求延迟的分位数分布趋势(ms) |
首 Token 延迟 TTFT P50/P95/P99 | 展示流式响应首 Token 延迟的分位数趋势(ms) |
Token 消耗趋势 | 展示输入/输出 Token 的堆叠趋势图 |
4. 查看 Top 榜单
面板名称 | 说明 | 用途 |
Top Token 消耗(按模型 API) | Token 消耗量最高的 Top 模型 API | 识别高消耗 API,优化成本 |
Top 请求量(按消费者) | 请求量最高的 Top 消费者 | 了解流量分布,合理分配配额 |
Top 平均请求延迟(按模型 API) | 平均延迟最高的 Top 模型 API | 定位延迟高的 API,优化性能 |
Top 错误率(按模型 API) | 错误率最高的 Top 模型 API | 快速发现异常 API,排查问题 |
Top 首 Token 延迟 TTFT(按模型 API) | TTFT 延迟最高的 Top 模型 API | 优化流式响应体验 |
场景二:查看 LLM 监控
LLM 监控提供大模型调用的专项指标,帮助您深入分析 LLM 请求的性能特征。
1. 核心指标卡片
指标卡片 | 说明 |
总请求数 | LLM 请求的总数 |
P95 延迟 | 端到端延迟的 95 分位值(ms) |
P99 延迟 | 端到端延迟的 99 分位值(ms) |
错误率(%) | LLM 请求的错误率 |
首 Token 延迟 P95 | 流式响应 TTFT 的 95 分位值(ms) |
Token 消耗量 | LLM 请求的总 Token 消耗 |
Input Token 总量 | 输入 Token 的总数 |
Output Token 总量 | 输出 Token 的总数 |
Token 生成速率(tok/s) | 平均每秒生成的 Token 数 |
Input Cache 命中率(%) | Prompt Cache 命中的 Token 占比 |
LLM HTTP 请求数 | LLM HTTP 请求的总数 |
Chat 操作数 | Chat Completion 请求数 |
2. 查看 LLM 趋势与分布面板
面板名称 | 说明 |
延迟分位数趋势(P50/P95/P99) | 展示 LLM 请求延迟的分位数变化趋势 |
Input/Output Token 趋势(堆叠) | 展示输入/输出 Token 的堆叠趋势 |
Prompt 长度分布(Input Token 直方图) | 展示 Prompt 长度的分布情况 |
TTFT 首 Token 延迟 P50/P95/P99 | 展示流式响应首 Token 延迟的分位数趋势 |
TTFT 分布直方图 | 展示 TTFT 的分布直方图 |
按 Provider 分组 TTFT P95 | 按不同供应商分组展示 TTFT P95 |
Provider 响应时间 P95 | 各供应商的后端响应时间 P95 |
Provider 吞吐量(请求数) | 各供应商的请求吞吐量 |
Top 调用流量 Top10 | 调用量最高的 Top10 消费者/API |
说明:
Input Cache 命中率反映模型侧 Prompt Cache 的命中情况,命中率越高说明重复 Prompt 越多,可通过启用 AI 网关缓存进一步降低成本。场景三:查看 MCP 监控
MCP 监控提供 MCP 工具调用的专项指标,帮助您监控 MCP Server 和 Tool 的健康状态。
1. 核心指标卡片
MCP 监控页顶部展示 3 个核心指标卡片:
指标卡片 | 说明 |
工具调用次数 | MCP Tool 的总调用次数 |
工具成功率 | Tool 调用成功的比例 |
工具 P99 延迟 | Tool 执行时长的 99 分位值(ms) |
2. 查看 MCP 趋势与排行面板
面板名称 | 说明 |
工具调用趋势(按工具分组) | 各 Tool 的调用次数趋势 |
成功率/参数错误率趋势(%) | Tool 调用成功率和参数错误率的趋势 |
按工具 P99 延迟趋势 | 各 Tool 的 P99 延迟趋势 |
平均延迟趋势 | Tool 调用的平均延迟趋势 |
工具调用明细排行(按工具) | 各 Tool 的调用次数、成功率、延迟明细排名 |
场景四:在 CLS 控制台自定义分析
当日志大盘的预设面板无法满足分析需求时,您可以跳转至 CLS 控制台进行自定义分析。
操作步骤
1. 在日志大盘页面右上角,单击 在日志服务中查看更多
2. 系统将自动跳转至腾讯云 CLS 控制台对应的日志主题
3. 在 CLS 控制台,您可以:
使用 SQL 语句自定义查询日志数据
创建自定义仪表盘和图表
配置日志告警规则
导出日志数据用于离线分析