首页
学习
活动
专区
圈层
工具
发布
首页
学习
活动
专区
圈层
工具
MCP广场
社区首页 >专栏 >GPT-SoVITS实战指南:把小说变成自然语音的有声书

GPT-SoVITS实战指南:把小说变成自然语音的有声书

作者头像
小新笔记坊
发布2025-07-09 09:38:15
发布2025-07-09 09:38:15
8890
举报
文章被收录于专栏:小新笔记坊小新笔记坊

GPT-SoVITS的功能?

零样本文本到语音 (TTS): 输入 5 秒的声音样本, 即刻体验文本到语音转换。

少样本 TTS: 仅需 1 分钟的训练数据即可微调模型, 提升声音相似度和真实感。

跨语言支持: 支持与训练数据集不同语言的推理, 目前支持英语、日语、韩语、粤语和中文。

WebUI 工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注, 协助初学者创建训练数据集和 GPT/SoVITS 模型。

运行环境

Windows10,显存至少6G,内存至少16G

操作步骤

1.下载GPT-SoVITS

2.解压压缩包。

3.运行go-webui.bat

4.启用推理。

5.上传主参考音频。音频需人声清晰,去掉除人声以外所有声音,音频控制在10秒以内。

6.开始合成音频。

参数设置

GPT模型列表:使用V3底模效果最佳。

SoVITS模型列表:使用v2ProPlus底模效果最佳。

使用方式:直接使用底模+上传参考音频方式合成效果最佳。不要自行训练,自行训练除非硬件条件非常好,且数据样本质量非常高,数据标注非常好,否则自行训练的模型不如底模直接合成音频声音自然。

如何切分:作者建议每四句一切。

并行推理:建议关闭。实际测试同等条件下并行推理速度更慢,消耗内存更多,在有限内存下能够合成的文字数更少。

模型对比

V1:支持语种为中日英。GPT训练集时长约2k小时。SoVITS训练集时长约2k小时。参数量为90M+77M。

V2:支持语种为中日英韩粤。GPT训练集时长约2.5k小时。SoVITS训练集时长约5k小时。参数量为90M+77M。

V3:支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为330M+77M。

V4:支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为330M+77M。

V2Pro:支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为133M+77M。

V2ProPlus:支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为152M+77M。

总结

benchmark跑分看,没有必要再用V3或V4,因为V2Pro系列和v2硬件需求一样,但是zero shot相似度和V3或V4同一水平线。

实际使用记录

RTX2060-6G+32G内存

注:每次最多合成约35万字,目前每次合成约30万字。

合成22万字

约耗时3小时,占用内存16G,推理约70it/s

合成30万字

约耗时4.5小时,占用内存20G,推理约70it/s

GTX1060-6G+16G内存

注:每次最多合成约15万字,目前每次合成约15万字。

合成15万字

约耗时5小时,占用内存11G,推理约26it/s

感谢

感谢作者RVC-Boss开发出该项目并开源供所有人使用。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2025-07-08,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • GPT-SoVITS的功能?
  • 运行环境
  • 操作步骤
  • 参数设置
  • 模型对比
    • 总结
  • 实际使用记录
    • RTX2060-6G+32G内存
      • 合成22万字
      • 合成30万字
    • GTX1060-6G+16G内存
      • 合成15万字
  • 感谢
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档