
做短视频最容易让人烦的,往往不是某一步特别难,而是步骤太碎。
先想主题,再写文案;文案有了,还要找图、配音、挑 BGM、调画面比例,最后再导出。单独看每一步都不算复杂,但来回切几个工具,一条视频还没做完,耐心已经先被消耗掉一半。
所以我看 Pixelle-Video 时,最关心的不是“它能不能一键封神”,而是一个更实际的问题:
能不能把文案、配图、配音、BGM 和最终成片尽量收进一条连续流程里?
原文已经给出了一条比较完整的操作链:
Windows 启动 Pixelle-Video → http://localhost:8501 打开 Web 页面 → 配置 LLM → 配置图像服务 → 选择 AI 生成或固定文案 → 配置 BGM 与画面参数 → 生成视频 → 在 output 找到成片 → 历史记录里继续调整 → 最后通过cpolar把 8501 页面提供到公网。
这篇我采用的性格也比较明确:
喜欢自动化,但不迷信“全自动”。只要能少切几个工具、少重复几遍机械操作,我就觉得值;至于文案和画面最终能不能用,还是得自己看。

原文把“日更短视频”作为典型使用场景。

我更愿意把它理解成:先让机器把第一版流程跑出来,再决定哪些地方值得人工继续修。
原文将 Pixelle-Video 介绍为一套 AI 自动短视频生成引擎,重点覆盖从内容到成片的连续流程。

原文列出的主要能力包括:

对我来说,真正有吸引力的是第 3 点。
因为“自动生成”并不难听,难的是生成以后还能不能继续改。如果第一版不满意,能换模板、改提示词、调整配音再生成,这才更符合真实创作过程。
原文项目地址:
AIDC-AI/Pixelle-Video: 🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine
下载整合包以后解压到本地。

进入文件夹后,双击:
start.bat

启动后,系统会打开:
http://localhost:8501

进入 Pixelle-Video Web 操作界面。

到这里,我只确认一件事:
本地 Web 服务已经正常启动。
真正能不能出片,还要继续配置模型和图像服务。
第一次使用时,展开左侧的“系统配置”。

原文说明可以从下拉菜单选择预设模型,例如通义千问、GPT-4 等。
本次实际选择的是:
Deepseek
选择以后,系统会自动填充 base_url 和 model 信息。

接着通过“获取 API Key”入口注册并获取 API Key。

如果预设里没有需要的模型,也可以手动填写:

我比较喜欢这种设计。
因为模型配置不是被写死的,后面如果觉得某个模型写出来的文案太像模板,就还能继续换,而不是整个工具只能接受一种生成风格。
原文提供了本地和云端两种思路。
如果希望降低本地显卡要求,原文选择的是云端方案,并进入 RunningHub。

随后在 RunningHub API 控制台生成 API Key,再回到 Pixelle-Video 配置页面填写。

如果希望本地运行,原文也提到可以使用本地 ComfyUI 自行配置。
配置完成后点击“保存配置”。

到这里,文案模型和图像服务都已经接上,才算真正进入“可以开始生成视频”的阶段。
Pixelle-Video 提供两种输入方式:

这个区分很实用。
有时候我只想试一个主题,那就让 AI 先写;有时候文案已经确定,只想让它完成后面的图像、配音和合成,就直接用固定文案。
我不喜欢工具强迫我“必须全自动”,能让我决定从哪一步开始,反而更符合实际工作。
BGM 可以直接选择系统预置内容。
如果要使用自己的音乐,原文做法是把音乐文件放进项目的:
bgm
文件夹。

原文还可以设置:

这里其实已经说明了一件事:
Pixelle-Video 并不是“点一下以后什么都不用管”。
你仍然要决定模型、提示词、BGM、画面比例。
只不过这些原本散在不同软件里的选择,被集中到了一个页面里。
配置完成后点击“生成视频”。
原文显示系统会自动执行后续流程,并实时展示生成进度。
生成完成的视频会保存在项目:
output
文件夹中。

原文实测中,几分钟后生成了成片,并将视频导出到本地。
这里我会把“效果很好”“完全展示提示词”这种主观评价保留为原文体验,不继续扩展成“所有主题都能稳定生成高质量视频”。
真正值得确认的是:
从主题 / 文案配置到最终视频文件,这条自动流程确实跑通了。
生成以后,还可以在“历史记录”页面查看已有任务。
原文展示了:

这一点对我来说比“一次生成成功”更重要。
因为做内容很少有第一版直接能发的情况。真正省时间的是:发现问题以后,不需要重新从头搭一遍工作流。
原文随后给了一个很明确的情景:
出差在外,客户突然要求紧急做一条视频,但 Pixelle-Video 只运行在自己的 Windows 电脑上。
这个场景原文是举例,并不是已经发生过的真实经历,所以这里也保持为使用情景。
但它确实能说明远程访问为什么有意义。
如果模型、RunningHub、项目文件、BGM 和历史任务都已经配在这台电脑上,人在外面时重新换一套环境反而很麻烦。
所以这一层的目标很简单:
不迁移 Pixelle-Video,只把本地 8501 页面从外部网络打开。
原文通过 cpolar 官网注册账号并下载 Windows 版本。

下载后按默认流程完成安装。

安装完成以后,浏览器访问:
http://localhost:9200
使用 cpolar 账号登录 Web 管理界面。

这里的职责要保持清楚:
8501 Web 页面从外部网络访问。这样后面遇到生成失败时,不会把模型问题和网络问题混在一起查。
8501 配成固定公网入口登录 cpolar Web UI 后,进入【隧道管理 → 创建隧道】。
原文参数如下:
http8501China Top
接着登录 cpolar 官网,进入“预留”。

选择保留二级子域名:
china top保留以后复制子域名。

回到 cpolar 配置界面,将子域名粘贴到域名位置并创建。

创建完成后,打开在线隧道列表。
原文显示生成了两条固定公网地址。

最后复制其中一个地址,在其他设备浏览器打开。

页面能够正常访问,说明 Pixelle-Video 的 8501 Web 界面已经可以通过公网打开。
这里我只下到这个结论。
原文写“随时随地生成或者修改视频”,从页面访问层面已经验证远程入口能够打开;但正文没有进一步测试手机端完整生成流程、多人同时操作、长时间任务稳定性,所以这一版不把这些继续扩大成已经完整验证的能力。
这篇真正跑通的是两条链。
第一条是 视频生成链:
Pixelle-Video → LLM → 图像服务 → 内容模式 → BGM → 画面设置 → 生成视频 → output → 历史记录继续调整。
第二条是 远程访问链:
Windows 本地 8501 → cpolar → 固定二级子域名 → 其他设备浏览器打开。
原文实际完成了:
start.bat;http://localhost:8501;base_url 和 model;bgm 文件夹;output;http://localhost:9200 进入管理界面;8501 的 HTTP 隧道;China Top;这篇的人物性格也一直没变:
我喜欢自动化,但我更喜欢“能接管自动化”。
所以我不会把 Pixelle-Video 写成“输入一句话就再也不用管”。
对我来说,它真正省事的地方是:
原本要在文案、配图、配音、BGM、导出几个环节之间来回切,现在可以尽量把这些动作压进同一条工作流里。
原文中的“完全免费”“数据不泄露”“轻松日更多条”“几分钟就是高质量成片”“任何地方都能完整创作”等结论,没有在正文里逐项做成本、隐私链路、批量生成和远程完整任务测试,因此新版没有把这些继续写成已经验证的结果。
这比“全自动成片”听起来没那么夸张,但更接近一个真正会长期用工具的人在意的东西:第一版让机器跑,决定权留在自己手里。