帮你快速理解、总结文档立即下载

TPM 预留

最近更新时间:2026-08-12 17:47:30
我的收藏

什么是 TPM 预留

TPM 预留是大模型服务平台 TokenHub 提供的预付费吞吐保障模式。TPM(Tokens Per Minute)表示模型每分钟可处理的 Token 量。开通 TPM 预留后,在已购 TPM 或保障包额度、适用模型和地域范围内,可提供相应的预留吞吐能力,有助于降低因共享资源高峰导致的限流风险;超过已购额度或不满足适用条件的请求,按产品规则处理。具体保障范围、限流规则及适用条件以控制台和产品文档为准。

适用场景

稳定生产吞吐:业务已上线生产且调用量相对稳定,需要明确的吞吐保障。
高峰防限流:业务存在明显流量高峰,需要保障高峰时段每分钟可处理的 Token 量。

计费说明

TPM 预留采用预付费模式,按月购买,价格请参见 TPM 预留价格。超过预留 TPM 额度后,超出部分按标准按量付费价格计费,价格请参见 模型价格

如何使用

注意:
TPM 预留需联系您的商务经理开通后方可使用。
1. 登录 TokenHub 控制台,在左侧导航选择推理服务 > 在线推理
2. 单击创建自定义推理服务
3. 在模型列表中选择需要使用的模型。
4. 计费方式中选择 TPM 预留(预留固定 TPM 吞吐额度保障稳定调用,超出预留部分按 Token 计费)。
5. 按需配置购买额度(输入与输出 kTPM)与购买时长。TPM 预留暂不支持自动续费,后续版本将支持。
6. 确认费用预估并同意相关服务协议后提交订单,完成创建。
控制台配置示例(GLM 5.2)


注意事项

暂不支持变配。
暂不支持自助退费。如需申请退费,请 提交工单,退费规则请参见 预付费云资源退款规则说明,按订单剩余价值退款,具体退费金额以工单审核结果和订单约定为准。
更多权益边界(是否独享资源、是否承诺固定吞吐、适用模型/地域、超额或超出保障额度后的处理、是否支持变配/续费/退费等)请参见 推理模式介绍

相关文档