首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >可灵发布 2.0 版重磅升级,视频生成能力全面提升

可灵发布 2.0 版重磅升级,视频生成能力全面提升

作者头像
不二小段
发布2026-04-09 14:59:27
发布2026-04-09 14:59:27
9500
举报
文章被收录于专栏:不二小段不二小段

可灵今天发布了 2.0 升级版本,视频生成能力再次提升。

我只想说,快手老铁们太卷了,可灵发布 10 个月以来,迭代了 20 多次。在上个月底的榜单上,可灵 1.6 和 可灵 1.5 就已经拿下图生视频榜一和文生视频榜二,这么快就又发布了可灵 2.0 版本,这波更新之后,应该能霸榜视频生成榜单。这波真的是遥遥领先,进化速度太恐怖了。

Image
Image

接下来就带大家快速看一下可灵这次更新的效果。

「可灵 2.0」:打破真实和虚拟的边界

可灵 2.0 这次把自己叫做「大师版」,实际效果也的确无愧大师的名号。

Image
Image

可灵 2.0 在视频生成上的表现,可以用三大维度来概括:语义响应、动态质量、画面美学。可灵针对每个维度都针对行业痛点进行了针对性优化,通过优化视觉和文本信息的融合机制,使用更高效的 Transformer 结构,让模型能精准理解复杂 Prompt 中的语义、动作、场景等细节,生成效果拉满。

语义响应:从文字到动作,精准还原创作者意图

语义响应是视频生成的核心,直接决定 AI 能否「听懂」用户的想法。可灵 2.0 在这方面实现了三大突破:复杂动作的理解和呈现大幅提升、支持丰富的运镜术语、通过优化时序建模,确保背景、主体和动作的连贯性。

我们来看一个时间镜头比较复杂的。

Prompt:

女孩从静坐在公园长椅上,到慢慢走出画面,晨光逐渐转为正午烈日再过渡至暮色四合,天空色彩从粉橙渐变为湛蓝再转为紫红,来往行人形成流动的虚影轨迹,固定镜头,突出光影在长椅木纹上的缓慢爬行,飘落的树叶在长椅下堆积又随风卷起。

可灵 1.6:

可灵 2.0:

可以看出,可灵 1.6 在后半部分镜头有点失控,跟前半段基本没啥关系了,但 2.0 全程都很稳,能保持画面的一致性,实现了延时摄影的效果。

动态质量:复杂动作更真实,运动逻辑更合理

动态质量是视频生成的老大难问题,过去模型常出现「速度不均衡」或「违反物理规律」的尴尬。可灵 2.0 通过技术优化,提高了复杂动作的完成度,对运动幅度进行了精细调校,避免了过快或过慢的失真感,通过算法优化,消除了慢动作或过快运动的 Bug。

看一个复杂动作的:

Prompt:

滑板运动,围绕滑板少年不断运动

可灵 1.6:

Image
Image

可灵 2.0:

Image
Image

可灵 1.6 的动作不是很连贯,而且速度有点慢,2.0 的动作就非常丝滑了。可灵 2.0 在运动镜头方面效果真的很惊艳,比如这种第一人称骑马的高速镜头,能给出很强的运动感和速度:

Image
Image

画面美学:电影质感,细节拉满

可灵2.0在画面美学上的表现,直接对标好莱坞大片,让普通用户也能生成「电影级」视频。

Image
Image

「多模态编辑」:让视频创作更加可控

可灵引入了 MVL(多模态视觉语言)理念,打破了文字描述的局限,通过图片、视频、动作轨迹等输入方式,让用户能更精准地表达复杂创意。并由此实现了「多模态编辑」等新功能。(不过这个功能 2.0 暂时不支持,可以先到 1.6 版本上使用)

简单来说,多模态编辑并不是凭空生成一段视频,而是能像 P 图一样 P 视频,对画面元素进行精准可控的修改

多模态编辑目前支持对视频中的元素进行「替换、删除、增加」三种操作。直接看视频:

「可图 2.0」:质量更高的风格转化

顺便一提,除了可灵视频生成大模型,图像生成大模型可图也升到了 2.0 版本。

前段时间知乎搞了个「AI 识别眼力赛」,让大家猜哪些图片是照片,哪些图片是 AI 生成,我在这里再放几张图,大家来猜猜哪几张是可图 AI 生成的。

Image
Image
Image
Image
Image
Image
Image
Image

……

……

……

答案是:全部都是 AI 生成。

说实话自己肯定是分不清的。难以想象,AI 在这么短的时间内,从不会画手,到现在已经能处理如此复杂元素,给出电影级的画面质感。

比如第二张图的 Prompt:

电影质感,法国影片,复古,自然光线,暖光,一个穿着浅绿色茶歇裙的女生抱着一捧花,躺在湖心的小木船闭眼哭泣,湖中有大片睡莲,前景有一棵大树,夕阳洒在湖中,水面波光粼粼。

这样的复杂指令遵循能力和写实画风绝对也是全球第一梯队的。

有这样的基础模型打底,可图的其他能力也不会差。比如 GPT-4o 新版本发布以后,大家沉迷于让 4o 制作各种风格的图片,可图这次专门更新了「风格转绘」,吉卜力、油画、纸雕、毛毡、糖果、微缩…真正突破了想象力的边界,可以任意将元素、风格、镜头组合出创意画作:

Image
Image

比如用工笔写意的画面让林黛玉玩手机:

Image
Image

可图 2.0 除了风格转换,还能局部重绘、扩图,跟视频功能配合起来用,可以说真正提高了生产力。


今天的发布会上有几组比较,我觉得用户其实能一眼看出生成效果的差别,可灵在视频生成领域就是断档领先。

Image
Image

那么,普通人咋玩?

很简单,开箱即用。可灵延续了一贯的风格,不搞期货,发布即可用。现在上网页端或 App 就能体验到最新的 2.0 版本。

快手今天还正式宣布要搞「可灵AI NextGen 新影像创投计划」,准备投入千万资金扶持全球创作者,普通人也有机会让自己的 AI 短片登上巴黎、东京的广告大屏。

Image
Image

从去年年初的 Sora 发布,到现在可灵代表国产大模型站在行业领先地位,我觉得虽然可灵正在一步步接近并超越当初 Sora 吹下的牛。可灵能让普通人也用上,更能听懂用户的需求。所以你说中国视频大模型是不是在全球领先?

创意无忧,灵感成真,可灵 AI 就是普通人的筑梦机器!

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2025-04-15,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 「可灵 2.0」:打破真实和虚拟的边界
    • 语义响应:从文字到动作,精准还原创作者意图
    • 动态质量:复杂动作更真实,运动逻辑更合理
    • 画面美学:电影质感,细节拉满
  • 「多模态编辑」:让视频创作更加可控
  • 「可图 2.0」:质量更高的风格转化
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档