国际科技财经博客移民网络热点娱乐民生时事公众号

>

抖音跳舞不用真人出镜，一张照片就能生成高质量视频！字节新技术连抱抱脸CTO都下场体验了

抖音跳舞不用真人出镜，一张照片就能生成高质量视频！字节新技术连抱抱脸CTO都下场体验了

2023-12-06 04:12

金磊发自凹非寺
量子位 | 公众号 QbitAI

看！现在正有四位小姐姐在你面前大秀热舞：

以为是某些主播在短视频平台发布的作品？

No，No，No。

真实答案是：假的，生成的，而且还是只靠了一张图的那种！

真实的打开方式是这样的：

这就是来自新加坡国立大学和字节跳动最新的一项研究，名叫MagicAnimate。

它的作用简单来说可以总结为一个公式：一张图片 + 一组动作 = 毫无违和感的视频。

然后啊，这项技术一经公布，可谓是在科技圈里掀起了不小的波澜，众多科技大佬和极客们纷纷下场耍了起来。

就连HuggingFace CTO都拿自己的头像体验了一把：

顺便还风趣地开了句玩笑：

这算是健身了吧？我这周可以不去健身房了。

还有相当与时俱进的网友，拿着刚出炉的GTA6（侠盗猎车手6）预告片中的人物玩了一把：

甚至就连表情包们也成了网友们pick的对象……

MagicAnimate可以说是把科技圈的目光聚焦到了自己身上，因此也有网友调侃说：

OpenAI可以休息一下了。

火，着实是火。

一张图即可生成一段舞

那么如此火爆的MagicAnimate，该如何“食用”？

话不多说，我们现在就来手把手地体验一次。

目前项目团队已经在HuggingFace中开放了在线体验的页面：

操作也是非常得简单，只需三步即可：

上传一张静态人物照片
上传想要生成的动作demo视频
调整参数，点击“Animate”即可

例如下面就是鄙人照片和一段近期席卷全球的《科目三》舞蹈片段：

△视频源：抖音（ID：QC0217）

也可以选择页面下方提供的模版进行体验：

不过需要注意的是，由于MagicAnimate目前过于火爆，在生成的过程中可能会出现“宕机”的情况：

即便成功“食用”，可能也得排大队……

（没错！截至发稿，还是没有等到结果！）

除此之外，MagicAnimate在GitHub中也给出了本地体验的方式，感兴趣的小伙伴可以试试哦~

那么接下来的一个问题便是：

怎么做到的？

整体而言，MagicAnimate采用的是基于扩散模型（diffusion）的一个框架，目的就是增强时间一致性、保持参考图像的真实性，并提高动画保真度。

为此，团队首先开发了一个视频扩散模型（Temporal Consistency Modeling）来编码时间信息。

这个模型通过在扩散网络中加入时间注意力模块，来编码时间信息，从而确保动画中各帧之间的时间一致性。

其次，为了保持帧间的外观一致性，团队引入了一种新的外观编码器（Appearance Encoder）来保留参考图像的复杂细节。

这个编码器与以往使用CLIP编码的方法不同，能够提取密集的视觉特征来引导动画，从而更好地保留身份、背景和服装等信息。

在这两项创新技术的基础之上，团队进一步采用了一种简单的视频融合技术（Video Fusion Technique）来促进长视频动画的平滑过渡。

最终，在两个基准上的实验表明，MagicAnimate的结果要远优于以往的方法。

尤其是在具有挑战性的TikTok舞蹈数据集上，MagicAnimate在视频保真度方面比最强基线高出38%以上！

团队所给出的定性比较如下：

以及与cross-ID的SOTA基线相比，结果如下：

One More Thing

不得不说，诸如MagicAnimate的项目最近着实是有点火爆。

这不，在它“出道”前不久，阿里团队也发布了一个名叫Animate Anyone的项目，同样是只要“一张图”和“想要的动作”：

由此，也有网友发出了疑问：

这似乎是MagicAnimate和AnimateAnyone之间的战争。谁更胜一筹？

你觉得呢？

论文地址：
https://arxiv.org/abs/2311.16498

参考链接：
[1]https://github.com/magic-research/magic-animate
[2]https://twitter.com/cocktailpeanut/status/1732052908227588263
[3]https://twitter.com/ProductHunt/status/1732116454647136449
[4]https://twitter.com/Gradio/status/1731992981715231162
[5]https://twitter.com/dylan_ebert_/status/1732152096621813954

— 完 —

点这里👇关注我，记得标星哦～

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。

来源: qq

点击查看作者最近其他文章

相关阅读

偷鸡摸狗---暗搞台独 [旅游] 人生就是一场体验，到达相同的终点，体验不同的旅程——可可托海滑雪游记以高质量发展推动新时代西部大开发——重庆四川贵州高质量发展调研报告图灵三巨头激战持续升级！吴恩达痛批美国AI禁令扼杀开源，马斯克都下场了不用 20 张图！一张图就能生成 AI 头像，这个来自中国团队的项目太好用了欧美女星纷纷素颜出镜，大胆露斑点皱纹，连卡戴珊家族都加入？！被历史的演进湮没了的希腊科学真正实现一步文生图，谷歌UFOGen极速采样，生成高质量图像四川大学校友上市公司高质量发展大会在成都盛大举行推动“校地企”高质量融合发展让妻子全裸出镜，这导演太变态了后期狂喜！一张照片丝滑替换视频主角，动作幅度再大也OK｜Meta&新加坡国立大学深度学习三巨头论战升级！吴恩达痛批美国AI禁令扼杀开源，马斯克都下场了提升科技创新能力，推动重点产业链高质量发展——2024年推动工业和信息化高质量发展系列述评之二效果超越Gen-2！字节最新视频生成模型，一句话让绿巨人戴上VR眼镜视频生成新突破！字节跳动提出PixelDance：轻松呈现复杂动作与炫酷特效犀利！字节跳动早期投资人痛批抖音及张一鸣古交在春风中苏醒（上）比AI还智能！这个神器仅需一张图片就能生成3D立体模型图！（附神器下载）红色日记军（工）宣队 4.21-26 47岁的马伊琍，一张照片「封神」推动信息通信业高质量发展，为新型工业化夯实数字基础——2024年推动工业和信息化高质量发展系列述评之四《中国游戏纪事》第三集：腾讯米哈游莉莉丝出镜，中国游戏走向全球复旦大学联合华为诺亚提出VidRD框架，实现迭代式的高质量视频生成今日arXiv最热NLP大模型论文：IBM研究院提出Genie方法，自动生成高质量数据集特别策划｜聚焦进博：以高质量外资促高质量发展何立峰：以推动上市公司高质量发展助力信心提振、资本市场稳定和经济高质量发展《国家地理》杂志公布年度照片，29张照片从200万张候选照片中脱颖而出！一张照片生成视频，张嘴、点头、喜怒哀乐，都可以打字控制精确指出特定事件发生时间！字节&复旦大学多模态大模型解读视频太香了卫生巾究竟能吸多少血？有人用真血做实验了……中国“X”老板VS.日本“X”逸翁一张照片，TikTok小姐姐就都能跳舞了弥合2D和3D生成之间的次元壁！X-Dreamer：高质量的文本到3D生成模型字节新年礼盒火了央视主持李梓萌：“贷款”上班20年，戴假发出镜，真实面目让人惊讶！

热点事件追踪