AI 智能语音包括语音转文本、实时翻译和语音合成三个能力。
语音转文本:将音频转成文本(Automatic Speech Recognition,ASR)输出。
实时翻译:在语音转文本的基础上,将转写出来的文本翻译成目标语言。
语音合成:将文本合成为音频(Text-To-Speech, TTS)输出。
计费说明
AI 智能语音费用包含:语音转文本费用、实时翻译费用、语音合成费用。
后付费
付费方式 | 能力 | 类型 | 价格 | 说明 |
套餐外超量费用 (日结后付费) | 语音转文本(新) | 0.017 元/分钟 | 最新版基于大语言模型的语音转文本能力,支持中文普通话、中文方言、英语和小语种的识别。 | |
| | 0.013 元/分钟 | 最新版基于大语言模型的语音转文本能力,支持中文普通话、中文方言、英语和小语种的识别。 | |
| 实时翻译 | 0.07 元/分钟 | ||
| 语音合成 | 基础(原 Flash) | 3.00 元/万字符 | 支持将中文、英语、日语、韩语以及粤语方言文本实时转换为自然流畅的多音色语音。 |
| | 标准(原多语种) | | |
| | 声音克隆(Flash) | 9.9 元/次 | 按次计费,后付费。 |
注意:
购买 套餐包 赠送的 AI 智能语音时长,当赠送的抵扣量用尽且套餐包仍在有效期内时,超出的用量会按照套餐外超量费用进行计费。赠送时长用尽后仅影响计费方式(转为超量计费),不会改变或降级所使用的识别能力与模型。
新用户可在创建应用时一次性领取 1000 分钟语音体验时长,领取方式可参考开通服务文档里的指引。
套餐包费用
套餐包 | 套餐版本 | 套餐价格 | 赠送 AI 智能语音时长 | 折合实时语音识别时长 | 折合录音文件识别时长 |
基础版 | 475 元/月 限时 95 折 | 10,000 分钟/月 | ≈ 29000+ 分钟/月 | ≈ 38000+ 分钟/月 | |
| 尊享版 | 900 元/月 限时 9 折 | 20,000 分钟/月 | ≈ 58000+ 分钟/月 | ≈ 76000+ 分钟/月 |
尊享版 Plus(赠送 AI 智能语音时长) | 2875 元 限时 8 折 | 10,000 分钟/月 | ≈ 29000+ 分钟/月 | ≈ 38000+ 分钟/月 | |
| 旗舰版 Plus (赠送 AI 智能语音时长) | 8000 元 限时 8 折 | 20,000 分钟/月 | ≈ 58000+ 分钟/月 | ≈ 76000+ 分钟/月 |
说明:
购买 AI 智能语音时长包的任一规格的套餐包,均支持 语音转文本 API 文档 中所有语音转文本模型的识别。
套餐包的有效期为购买当日 - 次月当日。例如:2025 年 3 月 1 日购买,其有效时间为 2025 年 3 月 1 日 - 2025 年 4 月 1 日。
每个套餐针对单个 UIN 账号生效,可用于抵扣当前 UIN 账号产生的 AI 智能语音时长用量消耗。
AI 智能语音套餐包退费规则详情请参见 退费说明。
赠送的 AI 智能语音时长,按"语音转文本能力(新)"的抵扣比例折算与扣减,实时语音识别按 0.34 分钟/分钟、录音文件/一句话识别按 0.26 分钟/分钟 抵扣。因此同样的赠送时长,用于不同识别方式可使用的实际分钟数不同(见上表折合列与下表抵扣比例说明)。
抵扣比例说明
赠送的 AI 智能语音时长具体抵扣规则如下:
能力 | 类型 | 抵扣比例 |
语音转文本能力(新) | 实时语音识别 | 0.34 |
| 录音文件/一句话识别 | 0.26 |
实时翻译能力 | 翻译引擎 | 1.4 |
语音合成 | 基础(原 Flash) | 0.36 注意: 实际计费时,1字符可抵扣 0.36 秒的智能语音时长。 |
| 标准(原多语种) | |
说明:
接入说明
1. TRTC AI 智能语音解决方案支持以下接入方式:
实时语音场景:
无 UI 接入:支持通过 服务端接入,也可通过 TRTC SDK 接入 AI 转录/翻译,简化开发集成流程。
场景(含 UI)方案接入:目前已经支持 视频通话接入 AI 转录/翻译 方案和 多人会议接入 AI 转录/翻译 方案。助力快速上线含 UI 的场景化实时转录功能。
其他场景:
通过 API 调用 ASR / TTS 能力,适用于已有音频采集链路或仅需单点能力的场景:
2. AI 实时对话中配置语音转文字和语音合成具体接入步骤请参见 AI 实时对话跑通 Demo。
用量统计
语音转文本
只有开始参与 AI 智能语音的音频时长才进行用量统计。
主播多路流输入,若调用不同的语言引擎模型,则按照不同语言引擎单价进行区分收费。
只有在真人开启麦克风后,系统才会同步启用 ASR 服务识别语音内容,持续时间以真人开启麦克风持续时间为准。
注意:
使用 AI 智能语音服务时,将会有机器人作为虚拟观众加入房间,订阅需要识别的音频流。机器人费用按照 音视频时长计费规则 进行计费。
时长统计精度为秒,按 SDKAppID 维度,以每日累计秒数转换成分钟数后进行计费,不足一分钟按一分钟计。
实时翻译
按照参与 AI 智能语音翻译能力的音频时长进行用量统计。
主播单路流输入,若输出多种翻译语言,则按照输入的音频时长 * 输出的语种个数进行收费。
说明:
时长统计精度为秒,按日累计秒数转换成分钟数后进行计费,不足一分钟按一分钟计算。
语音合成
按照文字转语音的输入文本字符数量进行用量统计。
主播单路流输入,按照需要文字转语音的字符数量进行收费。
说明:
文本字符统计精度为万字符,按日累计字符数进行计费,保留四位小数。
1 个汉字算 2 个字符(包括日文汉字、韩文汉字或其他语言中产生和用到的汉字字符);每个英语字母,其他语言字符,标点符号,特殊符号,空格,回车等均统计为 1 个字符。
在实时翻译场景下,由于 ASR 识别存在非稳态中间结果,TTS 实际合成的字符数可能高于最终稳态文本字符数,计费以 TTS 实际处理的字符数为准。
计费示例
示例 1:仅使用语音转文本2.0 实时语音识别
某用户通过 API 调用实时语音识别 BigModel,当日累计识别时长 120 分钟。
计费类型 | 用量 | 单价 | 费用 |
语音转文本(实时语音识别) | 120 分钟 | 0.017 元/分钟 | 2.04 元 |
分析: 实时语音识别 BigModel 单价 0.017 元/分钟,用量120分钟,则费用为0.017 × 120=2.04 元。
示例 2:配合 TRTC —— 语音转文本 2.0 实时语音识别 + 实时翻译
用户 A 和 B 用中文通话,观众 C 需要看到英文字幕,观众 D 需要看到日文字幕。使用实时语音识别 BigModel 进行语音转文本,并开启实时翻译,通话 5 分钟。
计费类型 | 用户 A | 用户 B | 小计 |
语音转文本 | 5 分钟 | 5 分钟 | 10 分钟 |
实时翻译 | 5 分钟 × 2 | 5 分钟 × 2 | 20 分钟 |
分析:
语音转文本:共 10 分钟,实时语音识别 BigModel 单价 0.017 元/分钟,共 0.17 元。
实时翻译:共 20 分钟,单价 0.07 元/分钟,共 1.4 元。
合计:1.57 元。
示例 3:配合 TRTC —— 语音转文本 2.0 实时语音识别 + 实时翻译 + 语音合成
用户 A 和 B 用中文通话,观众 C 需英文字幕并听到英文语音,观众 D 需日文字幕并听到日文语音。使用实时语音识别 BigModel 进行语音转文本,同时开启实时翻译和实时语音合成,通话 10 分钟。假设英文语音合成字符量共 1.6 万字符,日文共 1 万字符。
计费类型 | 用户 A | 用户 B | 小计 |
语音转文本(实时语音识别) | 10 分钟 | 10 分钟 | 20 分钟 |
实时翻译 | 10 分钟 × 2 | 10 分钟 × 2 | 40 分钟 |
语音合成 | 0.8 万英文 + 0.5 万日文 | 0.8 万英文 + 0.5 万日文 | 2.6 万字符 |
分析:
语音转文本:共 20 分钟,实时语音识别 BigModel 单价 0.017 元/分钟,共 0.34 元。
实时翻译:共 40 分钟,单价 0.07 元/分钟,共 2.8 元。
语音合成:共 2.6 万字符,基础 (Flash) 单价 3 元/万字符,共 7.8 元。
合计:10.94 元。
注意:
本文计费示例采用刊例价计算,如果您与腾讯云的商务经理签订了合同,以合同约定的价格为准。
支持语言列表
功能 | 支持语言种类 | 支持方言种类 |
语音转文本 | 中文、英语、粤语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、罗马尼亚语、匈牙利语、马其顿语。 | 安徽、东北、福建、甘肃、贵州、河北、河南、湖北、湖南、江西、宁夏、山东、陕西、山西、四川、天津、云南、浙江、粤语(香港口音)、粤语(广东口音)、吴语、闽南语。 |
实时翻译 | 中文、英语、越南语、日语、韩语、印度尼西亚语、泰语、葡萄牙语、阿拉伯语、西班牙语、法语、马来语、德语、意大利语、俄语。 | / |
语音合成 | 中文、英语、日语、韩语 | 广东话 |
旧版模型
后付费
付费方式 | 能力 | 类型 | 价格 | 说明 |
套餐外超量费用 (日结后付费) | 语音转文本 1.0 | 0.05 元/分钟 | 支持中文普通话识别。对电话音频支持良好。 | |
| | 0.08 元/分钟 | 支持中文普通话、中文方言口音、英语以及中英混合的识别。识别性能和抗噪能力大幅增强。 | |
| | 0.15 元/分钟 | ||
抵扣比例
能力 | 类型 | 抵扣比例 |
语音转文本能力 1.0 | 基础语言引擎 | 1 |
| 标准语言引擎 | 1.6 |
| 高级语言引擎 | 3 |