
零样本文本转语音(Zero-Shot TTS)技术近年出现突破。微软于 2023 年发布的 VALL-E 模型仅需 3 秒语音示例便可克隆说话人声音,刷新业界对数据门槛的认知。随后开源的 Spark-TTS 进一步在更小模型上实现了近似甚至更优的效果(Ai Voice Cloning-以3秒音频就可克隆著称的网站就是宣称在此模型基础上自研),并原生支持多语言与细粒度可控。作为一名语音 AI 开发者,我将从架构原理、音质保真、推理效率、训练成本与实现复杂度五个维度,客观比较这两代代表性模型,探讨它们在语音克隆发展中的阶段性定位。
维度 | VALL-E | Spark-TTS |
|---|---|---|
编码机制 | 使用 EnCodec 将波形离散化为 codec 码 | BiCodec:语义 Token + 全局 Token |
生成策略 | 大型自回归 Transformer 逐 token 生成 codec | 中等规模 LLM 端到端生成语义 Token |
说话人控制 | 仅支持语音提示克隆 | 克隆、虚拟声、属性调节三合一 |
语言支持 | 英语(扩展版支持多语) | 原生中英双语,可扩展任意语种 |
开源程度 | 论文+演示,官方模型未公开 | 训练/推理全链路完全开源 |
VALL-E 把语音合成视为“补全离散音频码”任务:参考音频通过 EnCodec 编码后与文本共同作为条件,Transformer 自回归地生成后续 codec token,再解码还原波形。 Spark-TTS 则将语音表示拆解为 语义 Token(文本内容)和 全局 Token(说话人属性),利用 LLM 同时建模文本与音色,在一个模型里直接输出语义序列;随后 BiCodec 解码器结合全局 Token 复原音频,实现端到端合成。
维度 | VALL-E | Spark-TTS |
|---|---|---|
音色还原 | 极高,几乎完全复刻提示音 | 同级别还原,细节略柔和 |
韵律自然度 | 略显平稳,重音普通 | 断句、重音更贴合文本语义 |
情感/风格控制 | 难以显式调节 | 支持属性标签、自定义情感 |
跨语言克隆 | 原生仅英语 | 支持中英互转及多语言迁移 |
主观盲听中,两者在音色相似度上难分胜负;Spark-TTS 依托 LLM 的语言理解,对语义断句和重音处理更灵活。它还能通过修改全局 Token 属性,创造从未出现过的虚拟声或调整情绪强度,而 VALL-E 仅能忠实模仿参考音色。
项 | VALL-E | Spark-TTS |
|---|---|---|
语料规模 | 6 万小时英文 | 10 万小时多语 |
训练流程 | 编码器 + 语言模型多阶段 | 单模型端到端 |
复现难度 | 官方未开源,社区仅部分实现 | 代码与权重完整开源 |
算力要求 | 数十亿参数+长训练周期 | 单机多卡即可复现推理 |
VALL-E 率先证明极少样本克隆的可行性,但庞大的训练与闭源限制了公众复现。Spark-TTS 把概念落地为开源工程,极大降低了研发门槛。
VALL-E 与 Spark-TTS 分别代表零样本 TTS 的“开山”与“落地”。前者用巨量数据和算力证明极限音质;后者以解耦架构和开源生态让技术平民化。面对不同需求:若追求极致音色还原可等待 VALL-E 家族后续;需高效部署与可控生成则可优先 Spark-TTS。可以预见,下一代模型将兼具两者优点,为语音克隆带来更加真实、快速、多彩的体验。
o3
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。