Redian新闻
>
一句话让小姐姐为我换了N套衣服,谷歌卷出视频生成新高度,网友:竞赛加码

一句话让小姐姐为我换了N套衣服,谷歌卷出视频生成新高度,网友:竞赛加码

公众号新闻
鱼羊 发自 凹非寺
量子位 | 公众号 QbitAI

谷歌一出手,又把AI视频生成卷上了新高度。

一句话生成视频,现在在名为Lumiere的AI操刀下,可以是酱婶的:

“阳光明媚,帆船在湖中航行”

如此一致性和质量,再次点燃了网友们对AI视频生成的热情:谷歌加入战局,又有好戏可看了。

不止是文生视频,Lumiere把Pika的“一键换装”也复现了出来。

左谷歌右pika,同样是选中区域一句话完成视频编辑,你pick哪一边?

让图片中静止的火焰跃动起来,也同样一选就能完成:

还有图片转视频:

视频风格化:

总之就是主打一个质量又高又全能。

更多细节,我们论文扒起~

用于视频生成的时空扩散模型

Lumiere旨在解决以往视频生成中存在的几个关键问题:

  • 真实性

  • 样化

  • 运动的连贯性

在此前的方法中,常见的做法是,扩散模型先生成一些稀疏的关键帧,而后通过一系列时间超分辨率(TSR)模型来填补关键帧之间的空白,接着再用空间超分辨率模型获取高清视频结果。

可以想见,在全局连贯性上,这样的做法存在先天的缺陷。

Lumiere的创新点在于,提出了时空U-Net(STU-Net)架构:将视频在空间和时间两个维度同时进行下采样和上采样,在网络的中间层得到视频的压缩时空表示。

具体来说,基于这一架构,模型能够一次性生成视频中的所有帧——这也就提升了生成视频的连贯性。

同时,因为大部分计算发生在压缩后的表示上,STU-Net能有效减少计算量,降低对计算和内存的需求。

另外,为了提升视频的分辨率,研究人员使用多重扩散(MultiDiffusion)技术,通过线性加权空间超分辨率网络来处理重叠时间窗口带来的边界伪影等问题,从而能将生成画面融合为一个整体,得到连贯、高清的视频效果。

时长和分辨率方面,Lumiere能输出1024×1024、16fps下长5秒的视频。

研究人员提到:

5秒已经超过了大多数视频作品中的平均镜头长度。

值得一提的是,得益于时空U-Net架构端到端全帧率视频生成的能力和高效计算,Lumiere灵活可扩展,可以轻松应用到下游任务中,包括文生视频、图生视频、视频风格化、视频编辑修复等等。

视频修复

实验结果

研究人员将Lumiere与其他文本-视频生成模型进行了实验对比。

首先来看人类用户的判断。

实验设计是这样的:志愿者会同时看到一对视频,一个来自Lumiere,另一个来自其他基线模型。志愿者被要求从中选出视觉质量、动态效果更好,更符合文本提示的视频。

研究人员收集了大约400份反馈,结果显示,在视频质量、文本匹配度方面,Lumiere超越了Pika、Gen2、Imagen Video、SVD等一众顶级视频生成模型。

同时,在UCF101数据集(动作识别数据集)上,与MagicVideo、Make-A-Video、SVD等模型相比,Lumiere取得了具有竞争力的FVD和IS指标。

网友:谷歌,模型呢?

效果很惊艳,网友很兴奋,但桥豆麻袋……

这次,谷歌依然只放出了论文,没有试玩,更没有开源。

这种似曾相识的操作,把人快整麻了:

视频很不错,但是谷歌,你又不打算发布任何代码、权重,也不提供API了,对吗?

还有人想起了Gemini发布时那个造假的小蓝鸭视频……

那么,这波你还会看好谷歌吗?

论文地址:
https://arxiv.org/abs/2401.12945
项目地址:
https://lumiere-video.github.io/#section_video_stylization

—  —

点这里👇关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
吉他摇滚、电子音乐都能搞定,Meta开源音频生成新模型MAGNeT,非自回归7倍提速大学室友网聚之二GPT-4联手开源建模软件Blender,打破文本到视频生成的物理界限阿尔特曼称GPT-5提升超想象;库克在中国首谈生成式AI;字节推出视频生成新模型丨AIGC大事日报被Sora抢了风头的谷歌“杀”回来了!谷歌的一群“书呆子”卷出了最强开放模型Gemma文生视频下一站,Meta已经开始视频生视频了消息称创企Stability AI正寻求出售;斯坦福博士创立的AI创企Pika推出首款视频生成产品丨AIGC日报斯坦福美女博士创业项目爆火!AI视频生成出道即顶流,半年融资5500万美元吴亦凡案件的警示椰树擦边「擦」出新高度,网友骂其低俗,AI说:穿件衣服吧椰树!谷歌发布视频生成大语言模型 VideoPoet效果炸裂!OpenAI 发布首个视频生成模型,这就是 AI 视频的 GPT 时刻一句话让马斯克“上天”变成3D动画!生成式AI技术进入爆发期!视频生成新突破!字节跳动提出PixelDance:轻松呈现复杂动作与炫酷特效视频里有前男友?谷歌最新AI视频生成器 Lumiere,轻松让他消失AI早知道|百度推出视频生成模型UniVG;Soul APP上线自研语言大模型;清华大学首个大模型 DebugMeta清华校友推全新AI「视频生视频」方法!单张A100生成「男人秒变猩猩」大片百度腾讯推出视频生成模型;传美团AI视觉中心负责人离职;微软研究院回应关闭传言丨AIGC大事日报一句话让你雅思口语变成话痨(实测有效)日本一小姐姐摘下婚戒后离开,丈夫看到以为“被离婚”​!​结局曝光,网友:竟是这样??AI视频年大爆发!Gen-2/Pika成时代爆款,2023年AI视频生成领域的现状全盘点清华,谷歌,家暴男,网友的评论果然亮了效果超越Gen-2!字节最新视频生成模型,一句话让绿巨人戴上VR眼镜H-1B“一人一抽”!苹果蝉联《胡润世界500强》第一!中国考生GRE均分卷出新高度!专访Pika Labs创始人:探索视频生成的GPT时刻小学的虚假道德、中学的空洞理想、大学的无趣审美全新AI视频生成工具Pika爆火!做电影都不在话下,高颜值学霸创始人被评“近乎完美”,她父亲还有家A股上市公司……华裔美女开发AI视频生成器,6个月融资5500万美金刚刚,谷歌华人工程师被捕,他用谷歌电脑偷谷歌机密存到谷歌账号...文革受难群体之一: 有宗教信仰的人被 Sora 抢了风头的谷歌“杀”回来了!谷歌的一群“书呆子”卷出了最强开放模型 Gemma“滚…不要以为我不会打你”,柜员与客户起争执!工作人员:她因为一句话情绪激动!银行通报神与人谷歌发布AI视频生成模型;传微软组建新GenAI团队;蚂蚁成立AI创新部门丨AIGC大事日报Stability AI杀回来了:视频生成新Demo效果惊人,网友:一致性超群
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。