
很多人以为 AI 视频创作就是输入一句话,等几分钟,拿一条爆款。真正做过就知道:一键生成只能做 Demo,能交付的短片,背后都是“脚本 → 分镜 → 生成 → 配音 → 剪辑”的流水线。
好消息是,你不需要训练模型,也不需要写几百行代码。核心编排,20 行就够。
AI 视频 = 结构化脚本 + 分镜提示词 + 视频生成模型 + TTS + 自动剪辑。
人类负责故事、节奏和审美。AI 负责批量出画面、出声音、出字幕。代码负责把它们串起来。
先定义分镜,每个分镜一句话。然后循环调用视频生成 API,下载片段,最后用 ffmpeg 拼接。
import requests, subprocess
SHOTS = [
{"prompt": "深夜办公室,程序员敲代码,屏幕蓝光,特写,电影感", "dur": 4},
{"prompt": "代码在屏幕上流动,镜头缓慢推近,赛博朋克", "dur": 4},
{"prompt": "清晨城市醒来,程序员合上电脑,广角,暖光", "dur": 4},
]
def text_to_video(prompt, duration):
# 换成你用的服务:可灵 / Runway / Pika / 即梦
r = requests.post("https://api.example.com/video", json={
"prompt": prompt, "duration": duration
}, headers={"Authorization": "Bearer YOUR_KEY"})
return r.json()["video_url"]
clips = []
for i, shot in enumerate(SHOTS):
url = text_to_video(shot["prompt"], shot["dur"])
path = f"clip_{i}.mp4"
open(path, "wb").write(requests.get(url).content)
clips.append(path)
with open("clips.txt", "w") as f:
for c in clips:
f.write(f"file '{c}'\n")
subprocess.run(["ffmpeg", "-f", "concat", "-safe", "0", "-i", "clips.txt",
"-c", "copy", "final.mp4"])这段代码只做三件事:生成、下载、拼接。配音和字幕可以后面再加。
模板:
主体 + 动作 + 镜头 + 光线 + 风格 + 时长
例子:
一只机械猫,在雨夜街头奔跑,低角度跟拍,霓虹灯反射,赛博朋克,4 秒。
建议:
两条常用命令:
edge-tts --text "你的文案" --write-media voice.mp3
ffmpeg -i final.mp4 -i voice.mp3 -c:v copy -c:a aac -shortest output.mp4不要自己训视频模型。用 API 或 ComfyUI 工作流。
把变量抽出来:分镜列表、提示词模板、输出目录。换模型时,只换一个函数。
真正值钱的不是模型本身,而是你的脚本结构、分镜节奏和自动化流程。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。