什么是 TPM 预留
TPM 预留是大模型服务平台 TokenHub 提供的预付费吞吐保障模式。TPM(Tokens Per Minute)表示模型每分钟可处理的 Token 量。开通 TPM 预留后,在已购 TPM 或保障包额度、适用模型和地域范围内,可提供相应的预留吞吐能力,有助于降低因共享资源高峰导致的限流风险;超过已购额度或不满足适用条件的请求,按产品规则处理。具体保障范围、限流规则及适用条件以控制台和产品文档为准。
适用场景
稳定生产吞吐:业务已上线生产且调用量相对稳定,需要明确的吞吐保障。
高峰防限流:业务存在明显流量高峰,需要保障高峰时段每分钟可处理的 Token 量。
计费说明
如何使用
注意:
TPM 预留需联系您的商务经理开通后方可使用。
1. 登录 TokenHub 控制台,在左侧导航选择推理服务 > 在线推理。
2. 单击创建自定义推理服务。
3. 在模型列表中选择需要使用的模型。
4. 在计费方式中选择 TPM 预留(预留固定 TPM 吞吐额度保障稳定调用,超出预留部分按 Token 计费)。
5. 按需配置购买额度(输入与输出 kTPM)与购买时长。TPM 预留暂不支持自动续费,后续版本将支持。
6. 确认费用预估并同意相关服务协议后提交订单,完成创建。
控制台配置示例(GLM 5.2)
注意事项
暂不支持变配。
暂不支持自助退费。如需申请退费,请 提交工单,退费规则请参见 预付费云资源退款规则说明,按订单剩余价值退款,具体退费金额以工单审核结果和订单约定为准。
相关文档
推理模式介绍
模型单元
模型价格