Redian新闻
>
谷歌发布“Vlogger”模型:单张图片生成10秒视频

谷歌发布“Vlogger”模型:单张图片生成10秒视频

公众号新闻
丰色 发自 凹非寺
量子位 | 公众号 QbitAI

谷歌发布了一个新的视频框架:

只需要一张你的头像、一段讲话录音,就能得到一个本人栩栩如生的演讲视频

视频时长可变,目前看到的示例最高为10s。

可以看到,无论是口型还是面部表情,它都非常自然。

如果输入图像囊括整个上半身,它也能配合丰富的手势

网友看完就表示:

有了它,以后咱开线上视频会议再也不需要整理好发型、穿好衣服再去了。

嗯,拍一张肖像,录好演讲音频就可以(手动狗头)

用声音控制肖像生成视频

这个框架名叫VLOGGER

它主要基于扩散模型,并包含两部分:

一个是随机的人体到3D运动(human-to-3d-motion)扩散模型。

另一个是用于增强文本到图像模型的新扩散架构。

其中,前者负责将音频波形作为输入,生成人物的身体控制动作,包括眼神、表情和手势、身体整体姿势等等。

后者则是一个时间维度的图像到图像模型,用于扩展大型图像扩散模型,使用刚刚预测的动作来生成相应的帧。

为了使结果符合特定的人物形象,VLOGGER还将参数图像的pose图作为输入。

VLOGGER的训练是在一个超大的数据集(名叫MENTOR)上完成的。

有多大?全长2200小时,共包含80万个人物视频

其中,测试集的视频时长也有120小时长,共计4000个人物。

谷歌介绍,VLOGGER最突出的表现是具备多样性:

如下图所示,最后的像素图颜色越深(红)的部分,代表动作越丰富。

而和业内此前的同类方法相比,VLOGGER最大的优势则体现在不需要对每个人进行训练、也不依赖于面部检测和裁剪,并且生成的视频很完整(既包括面部和唇部,也包括肢体动作)等等。

具体来看,如下表所示:

Face Reenactment方法无法用音频和文本来控制此类视频生成。

Audio-to-motion倒是可以音频生成,方式也是将音频编码为3D人脸动作,不过它生成的效果不够逼真。

Lip sync可以处理不同主题的视频,但只能模拟嘴部动作。

对比起来,后面的两种方法SadTaker和Styletalk表现最接近谷歌VLOGGER,但也败在了不能进行身体控制上,并且也不能进一步编辑视频。

说到视频编辑,如下图所示,VLOGGER模型的应用之一就是这个,它可以一键让人物闭嘴、闭眼、只闭左眼或者全程睁眼:

另一个应用则是视频翻译:

例如将原视频的英语讲话改成口型一致的西班牙语。

网友吐槽

最后,“老规矩”,谷歌没有发布模型,现在能看的只有更多效果还有论文。

嗯,吐槽也是不少的:

画质模型、口型抽风对不上、看起来还是很机器人等等。

因此,有人毫不犹豫打上差评:

这就是谷歌的水准吗?

有点对不起“VLOGGER”这个名字了。

——和OpenAI的Sora对比,网友的说法确实也不是没有道理。。

大家觉得呢?

更多效果:
https://enriccorona.github.io/vlogger/
完整论文:
https://enriccorona.github.io/vlogger/paper.pdf

报名中!

2024年值得关注的AIGC企业&产品

量子位正在评选2024年最值得关注的AIGC企业、 2024年最值得期待的AIGC产品两类奖项,欢迎报名评选

评选报名截至2024年3月31日 

中国AIGC产业峰会同步火热筹备中,了解更多请戳:Sora时代,我们该如何关注新应用?一切尽在中国AIGC产业峰会

商务合作请联络微信:18600164356 徐峰

活动合作请联络微信:18801103170 王琳玉


点这里👇关注我,记得标星噢

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
谷歌7大模型22项AI大招轰炸:70秒视频生成、Gemini安卓合体、200万tokens上下文人工智能通过单张雷达图像生成3D城市地图谷歌发布AI视频生成模型;传微软组建新GenAI团队;蚂蚁成立AI创新部门丨AIGC大事日报贾玲公开瘦身食谱;马云妻子被曝在新加坡购房;报告称养娃到本科毕业平均花费68万元;谷歌发布开源AI大模型Gemma...钟睒睒等企业家个人信息遭售卖,移动、联通回应;谷歌发布会亮出十几款产品对阵OpenAI;比亚迪回应车辆漏电致人住院传闻|邦早报国内首个开源千亿参数MoE大模型来了!性能超Grok-1,单张GPU可跑短视频界的变革者:上海 AI lab 发布 Vlogger,几句话生成分钟级视频直播网友AI写歌征婚,实测最新登榜音乐SOTA模型:免费无限次,一键生成Suno v3音乐生成模型发布,几秒钟生成完整歌曲;富士通用生成式AI加速药物研发丨AIGC日报谷歌发布West-of-N,利用合成数据,显著提升LLM奖励模型质量 | 今日Arxiv最热大模型论文劳伦斯:久别重逢刘苏里仅剩5天过年,女星张馨予8秒视频突然刷屏:这才是世界的真相Stability AI开源3B代码生成模型:可补全,还能Debug昇腾社区回应网传华为发布会大模型生成图片系人工操控;Sam Altman:新款语音模型GPT-4o尚未发货丨AIGC日报“我们坚持开源!”阿里云发布“地表最强”中文大模型:半年一迭代、性能翻倍?首个全开源时序预测基础模型:Zero-shot预测能力比肩从零训练最优模型今日arXiv最热CV大模型论文:国产开源视觉大模型InternVL 1.5发布,赶超GPT-4V水准《繁花》中的哪一首歌最让你感动?360度无死角!UC伯克利华人发布3DHM框架:一张图片即可模仿任意视频动作昨晚,谷歌发布「AI 超级全家桶」,但最大的创新却被 OpenAI 狙击了谷歌放大招,AI搜索引擎来了,发布最强AI模型!发布会现场:总共提了120次AI、视频模型登场......Mamba超强进化体一举颠覆Transformer!单张A100跑140K上下文一周重磅日程:中国经济数据,美国CPI,OpenAI、谷歌发布会,BATJ财报英伟达最强通用大模型Nemotron-4登场!15B击败62B,目标单张A100/H100可跑《早晨的故乡》&《橱窗》微软刚刚发布了VASA-1:单张照片生成超现实真人视频,还没开源但是性能SOTA不用 20 张图!一张图就能生成 AI 头像,这个来自中国团队的项目太好用了我的健康厨房 - 我是如何控制和管理血糖的张馨予8秒视频一夜刷屏!这次真相和我们想的不太一样……谷歌发布视频生成大语言模型 VideoPoet前途尽毁!芝加哥大学本科生全职offer被撤,只因发了一张图片……看透物体的3D表示和生成模型:NUS团队提出X-Ray谷歌发布了第六代TPU芯片Stable Video 3D震撼登场:单图生成无死角3D视频、模型权重开放纽约琐事(二)事事难料
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。