
想把晴天改成雪天,它可能只会往画面上撒雪花;想把一段动画植入商场LED大屏,它可能鸿沟乱飘、透视不稳。
于是乎,问题来了:AI视频生成,能不能先了解创造者究竟想改什么,再着手生成?
Bernini的思路很直接,让多模态大模型先担任语义了解与规划,再交给diffusion模型完结高质量视觉烘托。
在才能上,Bernini覆盖了参阅生成、视频修改等多种使命,要点表现的就是两个字:「可控」。
比方改动全体视觉风格时,不只是把单帧画得美观,还能稳住前后帧的共同性,主打一个作用超级稳:
这下好了,AI视频生成也能从听prompt干活,往先了解、再着手再进一步了~
如果说曩昔许多视频生成模型更像按提示词出片,那Bernini想处理的,是另一个更实践的问题——
我们日常碰到的大多数调整需求听起来都很easy,但对视频模型来说并不简略!!!
由于视频修改不是改一张图,而是在一段接连画面里,既要听懂指令,又要保住主体、结构、镜头和运动关系。
前面担任导演的,是一个叫MLLM-based planner的多模态大模型规划器。
它会先看懂你的文本指令,也会一同了解源视频、参阅图片、参阅视频这些资料,判别方针画面应该变成什么样。
等这一步想清楚后,再交给diffusion模型DiT-based renderer来完结视觉烘托,把前面规划好的语义方针,实在变成接连、安稳、高质量的视频画面。
从文本到视频生成,到视频修改,再到根据图画和视频参阅的杂乱操控生成都悉数梭哈!
这套巧妙分工,也让Bernini在视频可控修改上,展现出了一批适当直观的视频修改才能。
最关键是,它处理的并不只是天上多几片雪、画面加一层滤镜,而是会连带调整天空、光照、路面、修建外表和全体环境气氛,让这场气候变化看起来像真的发生在原场景里:
在视角修改上,Bernini能进一步了解场景里的三维关系,让部分视角调整成果更契合透视、结构和空间逻辑:
在焦点修改才能上,Bernini还能够根据指令调整画面的重视区域,让视频叙事重心随之改动。
比方一个画面里有多个物体,我们我们能够让镜头更重视桌上的收音机,也能够让焦点从远景转到布景,so easy~
究竟许多AI视频静止看还行,一动起来就露馅:主体变形、动作开裂、布景漂移,镜头也跟着不稳!!
值得一提的是,Bernini在保存主体身份和场景结构的前提下,能够高精准度地改动主体动作行为。
我们来看下面这段棕熊视频,哪怕从一般状况改成动身跳舞、吼怒,环境、光照和镜头关系仍然能保持安稳~
这就意味着,Bernini改视频不只是让主体「动起来」,还要让动作变化「自然嵌进」本来的画面里。
尤其是碰到详细原料、某个产品、某种电影色彩,或许一段需求植入到屏幕里的视频资料,就更简单翻车…..
好巧不巧, Bernini除了修改的本事很强外,还有一个贼有用的才能:支撑图片和视频作为修改参阅。
不仅如此,它还能根据参阅输入直接生成新视频,把物体、人物和场景的共同性问题狠狠拿捏!!
详细来说,Bernini能够让创造者直接用视觉样例操控成果,广告构思、电商展现、影视预演、二次创造友友狂喜!!
比方下面这个添加指定主体的事例,只需求放入一张狗狗参阅图,视频里就能自然呈现同款狗狗。
再输入一张雪人图片,雪人也能顺滑融进其时视频里,光照、透视、边际关系都处理得十分自然:
比方给它布料、朱砂壶、大理石、金属等不一样的原料参阅,原视频里的盘子就能够被改成对应纹路视觉质感~
并且最重要的是,这种原料变化会跟着方针物体安稳存在,而不是播映几帧就漂移、错位或失真:
哪怕参阅图横跨卡通、写实、水墨、赛博朋克等彻底不同的视觉风格,Bernini也能提取风格特征并迁移到视频里。
值得一提的是,原视频里的主体和运动关系也会高度保存,风格变化也会跟着时间轴安稳接连:
此外在修改参阅中,Bernini还有一类很有用的才能,那就是:图画与视频植入。
我们都知道,街头灯箱、商场LED大屏、地铁电视,甚至镜头里任何一块屏幕,都能够变成展现位。
而Bernini能做的,就是把一张海报、一段视频精准填进方针区域里,还能跟着原片镜头一同移动,做到鸿沟不破、透视不乱、时序不抖。
例如给一段街头实拍再供给一张油画图片,Bernini就能把油画自然贴进招牌里,画面融合度也十分强:
广告预览、影视预演、虚拟拍摄里,许多本来要重复抠帧、盯梢、校透视的工作,这下也能被收进了一次推理里了~
顺带提一嘴,除了修改已有视频,Bernini还支撑根据参阅图直接生成「新视频」。
比方只给一张香水产品图,再输入「生成一段产品展现视频」的提示词,模型就能生成真人手持香水滚动的画面。
更有意思的是,换成一条运动头带,再让模型自由发挥,它还能生成一只羊驼戴着头带站在沙漠的画面:
同一个才能,既能做正派产品片,也能搞脑洞构思短片,属实有点666了啊??
在此我需求要大大点赞的一点是,我们喂进去的参阅图不一定需求来自同一个物体!!!
比方一座大理石半身像、一副粉耳耳机、一件的黑色T恤、一条热带印花短裤,再加一张落日海滩长椅。
几张图本来八棍子撂不着,但Bernini却能够把它们组合成同一个视频人物:
(谁成想呢,NanoBanana其时大热的ootd玩法现已进阶到「视频」版别了!)
这类才能放到IP联名、虚拟人塑造、广告概念片里就很有用,资料库里本来涣散的元素,能够被从头组合成一个全新的人物和场景~
我们都知道,产品和人物很少只要一面,包有背带,车有尾灯,雕塑有侧脸和反面,模型如果只看过正面,镜头一转,很简单开端自由发挥。
比方喂给它大理石雕塑的五张多角度参阅,再让它生成一段接连镜头,雕塑从不同角度呈现时,五官、肌肉走向、衣袍褶皱都能保持高度共同:
给到同一工作区歇息廊的几张关键帧,比方沙发、绿植、走廊止境的玻璃门,Bernini能够生成一段接连平移镜头:
由于它考验的现已不只是这一帧好不美观,还包括模型能不能了解同一个场景在接连镜头里的空间关系。
虚拟周游、游戏关卡生成、影视预演,甚至具身智能模仿,往后都绕不开这种接连性。
所以问题来了,Bernini为什么能一起吃文本、视频、参阅图,还能把成果做得更稳?
就像前面说到的,其中心原因首要在于它没有让一个模型包揽一切工作,而是把使命拆成了两步。
它不直接规则每个像素长什么样,而是先描绘清楚:方针视频应该包括什么内容、结构怎样变、哪些元素要保存、哪些当地要被修改。
拿到语义规划后,DiT-based renderer会担任生成终究画面,关于视频修改使命,它还会结合源视频的VAE features,尽量保存原视频里的细节和非修改区域,防止一改就把整段画面带跑。
当多个参阅图、源视频、方针视频被串进同一个序列里时,不同资料有极大几率会呈现相同的时间和空间坐标,模型简单认混。
它会给不同视觉片段加上各自的segment符号,让模型辨明:哪个是参阅图,哪个是源视频,哪个是方针输出;一起还能保存时间和空间方位关系。
值得一提的是,在字节商业化技能团队自建的Arena成果里,Bernini的方位也很有看头——
面临几款国内外干流闭源模型,这个开源框架没有被摆开距离,反而现已站进了榜首队伍:
说究竟,Bernini最让创造者有实感的当地,不只是画面更美观,而是它让AIGC创造少了一点「形而上学」。
曾经我们写了一大段prompt,AI未必懂;想改一个小当地,它可能整条视频都重来;给了参阅图,它也可能只学到一点皮裘,最终主体、原料、风格全都跑偏。
它先了解用户想要什么,了解原视频里哪些内容要保存,也了解参阅图片、参阅视频究竟供给了什么视觉信息。
少一点重复碰运气,多一点实在可控的创造空间,这也是Bernini最有价值的当地——
让我们用自己的资料、自己的主意,去探究AI视频创造还能怎样变得更好用、更听话、更挨近实在创造流程。
对了,需求一提的是,现在首先开源的Bernini-R,对应Bernini三阶段练习流程中的第二阶段模型。
而包括MLLM Planner的完好版别也在代码收拾中,估计近期将进一步开放,你们能够小小等待一会儿!
下一个:大理石纹路石纹大资料