首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >狂揽17.6k+star的短视频工具,一键全自动搬运AI字幕组,网飞级别,

狂揽17.6k+star的短视频工具,一键全自动搬运AI字幕组,网飞级别,

作者头像
豆芽菜小萌
发布2026-09-08 19:12:10
发布2026-09-08 19:12:10
300
举报

VideoLingo 是一站式视频翻译本地化配音工具,能够一键生成 Netflix 级别的高质量字幕,告别生硬机翻,告别多行字幕,还能加上高质量的克隆配音,让全世界的知识能够跨越语言的障碍共享。

主要特点和功能:

  • 🎥 使用 yt-dlp 从 Youtube 链接下载视频
  • 🎙️ 使用 WhisperX 进行单词级和低幻觉字幕识别
  • 📝 使用 NLP 和 AI 进行字幕分割
  • 📚 自定义 + AI 生成术语库,保证翻译连贯性
  • 🔄 三步直译、反思、意译,实现影视级翻译质量
  • ✅ 按照 Netflix 标准检查单行长度,绝无双行字幕
  • 🗣️ 支持 GPT-SoVITS、Azure、OpenAI 等多种配音方案
  • 🚀 一键启动,在 streamlit 中一键出片
  • 🌍 多语言支持就绪的 streamlit UI
  • 📝 详细记录每步操作日志,支持随时中断和恢复进度
  • 🔍 模型搜索选择器,自动从 API 获取完整模型列表,支持搜索筛选
  • ⏯️ 任务控制 — 处理过程中可随时暂停、继续或停止

与同类项目相比的优势:绝无多行字幕,最佳的翻译质量,无缝的配音体验

语言支持

输入语言支持:

🇺🇸 英语 🤩 | 🇷🇺 俄语 😊 | 🇫🇷 法语 🤩 | 🇩🇪 德语 🤩 | 🇮🇹 意大利语 🤩 | 🇪🇸 西班牙语 🤩 | 🇯🇵 日语 😐 | 🇨🇳 中文* 😊

*中文使用单独的标点增强后的 whisper 模型

翻译语言支持所有语言,配音语言取决于选取的TTS。

安装

注意: 在 Windows 上使用 NVIDIA GPU 加速需要先完成以下步骤:

  1. 安装 CUDA Toolkit 12.6
  2. 安装 CUDNN 9.3.0
  3. 将 C:\Program Files\NVIDIA\CUDNN\v9.3\bin\12.6 添加到系统环境变量 PATH 中
  4. 重启电脑

注意: FFmpeg 是必需的,请通过包管理器安装:

  • Windows:choco install ffmpeg(通过 Chocolatey)
  • macOS:brew install ffmpeg(通过 Homebrew)
  • Linux:sudo apt install ffmpeg(Debian/Ubuntu)

方式一:使用 uv(推荐,无需安装 Anaconda)

uv 会自动下载 Python 3.10 并创建隔离环境,你不需要自己安装 Python 或 Anaconda。

为什么用 uv 而不是 conda?

  • Anaconda 安装包约 4GB,而 uv 只有约 30MB
  • uv 能自动下载并管理所需的 Python 版本,不会和系统已有的 Python 冲突
  • 安装速度快 10-100 倍(Rust 编写,并行下载)
  • 一条命令搞定,不需要学习 conda 命令
  1. 克隆仓库
代码语言:javascript
复制
git clone https://github.com/Huanshere/VideoLingo.git
cd VideoLingo
  1. 一键安装(自动安装 uv + Python 3.10 + 所有依赖)
代码语言:javascript
复制
一键安装(自动安装 uv + Python 3.10 + 所有依赖)
  1. 启动应用
代码语言:javascript
复制
.venv\Scripts\streamlit run st.py        # Windows
.venv/bin/streamlit run st.py            # macOS / Linux

限制

  1. WhisperX 转录效果可能受到视频背景声影响,因为使用了 wav2vac 模型进行对齐。对于背景音乐较大的视频,请开启人声分离增强。另外,如果字幕以数字或特殊符号结尾,可能会导致提前截断,这是因为 wav2vac 无法将数字字符(如"1")映射到其发音形式("one")。
  2. 使用较弱模型时容易在中间过程报错,这是因为对响应的 json 格式要求较为严格。如果出现此错误,请删除 output 文件夹后更换 llm 重试,否则重复执行会读取上次错误的响应导致同样错误。
  3. 配音功能由于不同语言的语速和语调差异,还受到翻译步骤的影响,可能不能 100% 完美,但本项目做了非常多的语速上的工程处理,尽可能保证配音效果。
  4. 多语言视频转录识别仅仅只会保留主要语言,这是由于 whisperX 在强制对齐单词级字幕时使用的是针对单个语言的特化模型,会因为不认识另一种语言而删去。
  5. 无法多角色分别配音,whisperX 的说话人区分效果不够好用。

项目地址:https://github.com/Huanshere/VideoLingo

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-16,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 语言支持
  • 安装
    • 方式一:使用 uv(推荐,无需安装 Anaconda)
  • 限制
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档