帮你快速理解、总结文档立即下载

AI 智能语音

最近更新时间:2026-07-21 08:56:28

我的收藏
AI 智能语音包括语音转文本、实时翻译和语音合成三个能力。
语音转文本:将音频转成文本(Automatic Speech Recognition,ASR)输出。
实时翻译:在语音转文本的基础上,将转写出来的文本翻译成目标语言。
语音合成:将文本合成为音频(Text-To-Speech, TTS)输出。

计费说明

AI 智能语音费用包含:语音转文本费用、实时翻译费用、语音合成费用
说明:
配合 TRTC 使用,会产生音频通话费用和机器人进房费用。
以上能力均支持 开通服务 后,后付费使用,购买套餐包可享折扣抵扣

后付费

付费方式
能力
类型
价格
说明

套餐外超量费用

(日结后付费)
语音转文本(新)
0.017 元/分钟
最新版基于大语言模型的语音转文本能力,支持中文普通话、中文方言、英语和小语种的识别。
0.013 元/分钟
最新版基于大语言模型的语音转文本能力,支持中文普通话、中文方言、英语和小语种的识别。
实时翻译
0.07 元/分钟
支持15种语言的翻译,具体参见 支持语言列表
语音合成
基础(原 Flash)
3.00 元/万字符
支持将中文、英语、日语、韩语以及粤语方言文本实时转换为自然流畅的多音色语音。
标准(原多语种)
如果您需要中英日韩之外的语种支持,请通过商务经理或者 提交工单 联系。
声音克隆(Flash)
9.9 元/次
按次计费,后付费。
注意:
购买 套餐包 赠送的 AI 智能语音时长,当赠送的抵扣量用尽且套餐包仍在有效期内时,超出的用量会按照套餐外超量费用进行计费。赠送时长用尽后仅影响计费方式(转为超量计费),不会改变或降级所使用的识别能力与模型。
新用户可在创建应用时一次性领取 1000 分钟语音体验时长,领取方式可参考开通服务文档里的指引。

套餐包费用

套餐包
套餐版本
套餐价格
赠送 AI 智能语音时长
折合实时语音识别时长
折合录音文件识别时长
基础版
500 元/月
475 元/月
限时 95 折
10,000 分钟/月
29000+ 分钟/月
38000+ 分钟/月
尊享版
1000 元/月
900 元/月
限时 9 折
20,000 分钟/月
58000+ 分钟/月
76000+ 分钟/月
尊享版 Plus(赠送 AI 智能语音时长)
3625 元/月
2875 元
限时 8 折
10,000 分钟/月
29000+ 分钟/月
38000+ 分钟/月
旗舰版 Plus (赠送 AI 智能语音时长)
10000 元/月
8000 元
限时 8 折
20,000 分钟/月
58000+ 分钟/月
76000+ 分钟/月
说明:
购买 AI 智能语音时长包的任一规格的套餐包,均支持 语音转文本 API 文档 中所有语音转文本模型的识别。
套餐包的有效期为购买当日 - 次月当日。例如:2025 年 3 月 1 日购买,其有效时间为 2025 年 3 月 1 日 - 2025 年 4 月 1 日。
每个套餐针对单个 UIN 账号生效,可用于抵扣当前 UIN 账号产生的 AI 智能语音时长用量消耗。
AI 智能语音套餐包退费规则详情请参见 退费说明
语音转文本、实时翻译以及语音合成(在 AI 实时对话 方案中集成)并发限制 100,其他场景使用文字转语音限制 20 QPS。 若您有更高的并发需求,请 联系我们
赠送的 AI 智能语音时长,按"语音转文本能力(新)"的抵扣比例折算与扣减,实时语音识别按 0.34 分钟/分钟录音文件/一句话识别按 0.26 分钟/分钟 抵扣。因此同样的赠送时长,用于不同识别方式可使用的实际分钟数不同(见上表折合列与下表抵扣比例说明)。

抵扣比例说明

赠送的 AI 智能语音时长具体抵扣规则如下:
能力
类型
抵扣比例
语音转文本能力(新)
实时语音识别
0.34
录音文件/一句话识别
0.26
实时翻译能力
翻译引擎
1.4
语音合成
基础(原 Flash)
0.36
注意:
实际计费时,1字符可抵扣 0.36 秒的智能语音时长。
标准(原多语种)
说明:
赠送的 AI 智能语音时长支持 AI 实时对话 时长抵扣,抵扣比例是 1:0.2

接入说明

1. TRTC AI 智能语音解决方案支持以下接入方式:
实时语音场景:
无 UI 接入:支持通过 服务端接入,也可通过 TRTC SDK 接入 AI 转录/翻译,简化开发集成流程。
场景(含 UI)方案接入:目前已经支持 视频通话接入 AI 转录/翻译 方案和 多人会议接入 AI 转录/翻译 方案。助力快速上线含 UI 的场景化实时转录功能。
其他场景:
通过 API 调用 ASR / TTS 能力,适用于已有音频采集链路或仅需单点能力的场景:
能力
接入方式
说明
WebSocket 接入
通过 WebSocket 推送音频流进行实时流式识别。
HTTP POST 接入
上传音频文件,异步返回识别结果。
HTTP POST 接入
上传短音频(≤60s),同步返回识别结果。
HTTP POST 接入(SSE 流式)
输入文本,返回合成后的语音音频。
2. AI 实时对话中配置语音转文字和语音合成具体接入步骤请参见 AI 实时对话跑通 Demo

用量统计

语音转文本

只有开始参与 AI 智能语音的音频时长才进行用量统计。
主播多路流输入,若调用不同的语言引擎模型,则按照不同语言引擎单价进行区分收费。
只有在真人开启麦克风后,系统才会同步启用 ASR 服务识别语音内容,持续时间以真人开启麦克风持续时间为准。
注意:
使用 AI 智能语音服务时,将会有机器人作为虚拟观众加入房间,订阅需要识别的音频流。机器人费用按照 音视频时长计费规则 进行计费。
时长统计精度为秒,按 SDKAppID 维度,以每日累计秒数转换成分钟数后进行计费,不足一分钟按一分钟计。

实时翻译

按照参与 AI 智能语音翻译能力的音频时长进行用量统计。
主播单路流输入,若输出多种翻译语言,则按照输入的音频时长 * 输出的语种个数进行收费。
说明:
时长统计精度为秒,按日累计秒数转换成分钟数后进行计费,不足一分钟按一分钟计算。

语音合成

按照文字转语音的输入文本字符数量进行用量统计。
主播单路流输入,按照需要文字转语音的字符数量进行收费。
说明:
文本字符统计精度为万字符,按日累计字符数进行计费,保留四位小数。
1 个汉字算 2 个字符(包括日文汉字、韩文汉字或其他语言中产生和用到的汉字字符);每个英语字母,其他语言字符,标点符号,特殊符号,空格,回车等均统计为 1 个字符。
在实时翻译场景下,由于 ASR 识别存在非稳态中间结果,TTS 实际合成的字符数可能高于最终稳态文本字符数,计费以 TTS 实际处理的字符数为准。

计费示例

示例 1:仅使用语音转文本2.0 实时语音识别

某用户通过 API 调用实时语音识别 BigModel,当日累计识别时长 120 分钟
计费类型
用量
单价
费用
语音转文本(实时语音识别)
120 分钟
0.017 元/分钟
2.04 元
分析: 实时语音识别 BigModel 单价 0.017 元/分钟,用量120分钟,则费用为0.017 × 120=2.04 元。

示例 2:配合 TRTC —— 语音转文本 2.0 实时语音识别 + 实时翻译

用户 A 和 B 用中文通话,观众 C 需要看到英文字幕,观众 D 需要看到日文字幕。使用实时语音识别 BigModel 进行语音转文本,并开启实时翻译,通话 5 分钟。
计费类型
用户 A
用户 B
小计
语音转文本
5 分钟
5 分钟
10 分钟
实时翻译
5 分钟 × 2
5 分钟 × 2
20 分钟
分析:
语音转文本:共 10 分钟,实时语音识别 BigModel 单价 0.017 元/分钟,共 0.17 元
实时翻译:共 20 分钟,单价 0.07 元/分钟,共 1.4 元
合计:1.57 元。

示例 3:配合 TRTC —— 语音转文本 2.0 实时语音识别 + 实时翻译 + 语音合成

用户 A 和 B 用中文通话,观众 C 需英文字幕并听到英文语音,观众 D 需日文字幕并听到日文语音。使用实时语音识别 BigModel 进行语音转文本,同时开启实时翻译和实时语音合成,通话 10 分钟。假设英文语音合成字符量共 1.6 万字符,日文共 1 万字符。
计费类型
用户 A
用户 B
小计
语音转文本(实时语音识别)
10 分钟
10 分钟
20 分钟
实时翻译
10 分钟 × 2
10 分钟 × 2
40 分钟
语音合成
0.8 万英文 + 0.5 万日文
0.8 万英文 + 0.5 万日文
2.6 万字符
分析:
语音转文本:共 20 分钟,实时语音识别 BigModel 单价 0.017 元/分钟,共 0.34 元
实时翻译:共 40 分钟,单价 0.07 元/分钟,共 2.8 元
语音合成:共 2.6 万字符,基础 (Flash) 单价 3 元/万字符,共 7.8 元
合计:10.94 元。
注意:
本文计费示例采用刊例价计算,如果您与腾讯云的商务经理签订了合同,以合同约定的价格为准。

支持语言列表

功能
支持语言种类
支持方言种类
语音转文本
中文、英语、粤语、阿拉伯语、德语、法语、西班牙语、葡萄牙语、印尼语、意大利语、韩语、俄语、泰语、越南语、日语、土耳其语、印地语、马来语、荷兰语、瑞典语、丹麦语、芬兰语、波兰语、捷克语、菲律宾语、波斯语、希腊语、罗马尼亚语、匈牙利语、马其顿语。
安徽、东北、福建、甘肃、贵州、河北、河南、湖北、湖南、江西、宁夏、山东、陕西、山西、四川、天津、云南、浙江、粤语(香港口音)、粤语(广东口音)、吴语、闽南语。
实时翻译
中文、英语、越南语、日语、韩语、印度尼西亚语、泰语、葡萄牙语、阿拉伯语、西班牙语、法语、马来语、德语、意大利语、俄语。
/
语音合成
中文、英语、日语、韩语
广东话
注意:
语音转文本和语音合成的部分语种仅限特定版本类型支持,具体参考 不同引擎类型
语音合成暂不支持自主接入中英日韩之外的语种,如需其他语种支持请通过商务或者 提交工单 联系。

旧版模型

后付费

付费方式
能力
类型
价格
说明

套餐外超量费用

(日结后付费)
语音转文本 1.0
0.05 元/分钟
支持中文普通话识别。对电话音频支持良好。
0.08 元/分钟
支持中文普通话、中文方言口音、英语以及中英混合的识别。识别性能和抗噪能力大幅增强。
0.15 元/分钟
支持小语种精准识别。具体参见 语音转文本 > 高级版配置

抵扣比例

能力
类型
抵扣比例
语音转文本能力 1.0
基础语言引擎
1
标准语言引擎
1.6
高级语言引擎
3