大模型服务平台 TokenHub 提供按量付费、TPM 预留、模型单元三种推理模式,覆盖从灵活接入、日常生产到吞吐保障、专属资源的不同诉求。本文介绍三种模式的区别,帮助您根据业务场景选择合适的模式。
推理模式
按量付费
TPM 预留
TPM 预留是预付费的吞吐保障模式。您按 kTPM(千 Tokens Per Minute)粒度提前预留吞吐容量,开通后在已购 TPM 额度、适用模型和地域范围内,可提供相应的预留吞吐能力,有助于降低因共享资源高峰导致的限流风险。详细介绍请参见 TPM 预留。
模型单元
模型单元是资源独占的专属模型服务模式,为您提供专属推理资源及相应的资源隔离能力,并由平台统一托管运维,适用于对数据安全、资源隔离和专属资源有较高要求的业务场景。具体隔离范围、部署形态、网络边界和安全责任以产品文档及订单约定为准。详细介绍请参见 模型单元。
模式对比
对比项 | 按量付费 | TPM 预留 | 模型单元 |
计费模式 | 后付费,按实际 Token 消耗计费 | 预付费,按月购买 | 预付费,按月购买 |
保障内容 | 不提供吞吐保障 | 按 kTPM 粒度预留专属吞吐容量 | 专属的单位容量推理资源 |
资源形态 | 共享资源 | 共享资源 + 预留吞吐配额 | 专属推理资源 |
典型场景 | 业务起步、调用量波动大 | 稳定生产吞吐、高峰防限流 | 资源隔离、数据安全 |
开通方式 | 默认开通,无需申请 | ||
是否独享资源 | 否 | 否(共享资源 + 预留吞吐配额) | 是 |
是否承诺固定吞吐 | 否 | 在已购额度内承诺 | 提供单个单元容量预估,按需扩容 |
适用模型/地域 | 全部模型、全部地域 | GLM 5.2(广州) | 通用模型单元 B(广州) |
超额或超出保障额度后的处理 | 不适用 | 超出预留部分按标准按量付费价格计费 | 超出单元容量后会出现请求错误 |
是否支持变配、续费及退费 | 不适用 | 支持变配 暂不支持自动续费(后续版本将支持),退费需提交工单,退款按订单剩余价值计算,具体金额以工单审核结果和订单约定为准 | 支持变配 暂不支持自动续费(后续版本将支持),退费需提交工单,退款按订单剩余价值计算,具体金额以工单审核结果和订单约定为准 |
如何选择

相关文档
TPM 预留
模型单元
计费方式
模型价格