Redian新闻
>
Let’s Make-It-3D!上交&微软最新开源2D转3D生成研究,Star超过1k星

Let’s Make-It-3D!上交&微软最新开源2D转3D生成研究,Star超过1k星

公众号新闻

机器之心专栏

机器之心编辑部
给你几张照片,你可以猜到在三维世界中他们究竟长什么样子


我们可以凭借丰富的视觉先验知识,仅凭一张照片轻松推断出其3D几何形态及在不同视角下的样貌。这种能力得益于我们对视觉世界的深入理解。而今,恰如人类,一些卓越的图像生成模型,如Stable Diffusion和Midjourney,同样拥有丰富的视觉先验知识,展现出高质量的图像生成效果。基于这样的观察,研究员们提出假设:一个高质量预训练图像生成模型具有和人类一样的能力,即可以从一个真实或AI生成的图像中推理出3D内容。

这个任务非常具有挑战性,既要估计潜在的 3D 几何结构,也要同时产生未见过的纹理。基于之前的假设,来自上海交通大学、HKUST、微软研究院的研究者们提出了 Make-It-3D 方法,通过使用 2D 扩散模型作为 3D-aware 先验,从单个图像中创建高保真度的 3D 物体。该框架不需要多视图图像进行训练,并可应用于任何输入图像。这篇论文也被 ICCV 2023 所接收。



  • 论文链接:https://arxiv.org/pdf/2303.14184.pdf
  • 项目链接:https://make-it-3d.github.io/
  • Github链接:https://github.com/junshutang/Make-It-3D

该论文刚公布,就引发了推特上的热烈讨论,随后的开源代码在 Github 累计收获超过 1.1k星星。



那么方法背后的技术细节是什么呢?

该方法在优化三维空间时,主要依据两个核心的优化目标:

1. 在参考视角下的渲染结果应该与输入图片高度一致;
2. 在新视角的渲染结果显示与输入一致的语义。其中,研究者采用 BLIP2 模型来为图片标上文本。

基于这样的优化目标,在一阶段时期,该方法对参考视角周围的相机姿态进行随机采样。在参考视角下对渲染图和参考图施加像素级别的约束,在新视角下利用来自预训练扩散模型的先验信息度量图像和文本之间的相似性。


然而,只用文本难以描述一张图的全部信息,这会导致生成的 3D 模型难以和参考图像完全对齐。因此,为了增强生成几何模型和图片的相关程度,论文额外约束了在扩散过程中的去噪图和参考图之间 的图像相似性,即约束了图像之间的 CLIP 编码距离。这一方法进一步有效提升了生成模型和图片的相似程度。


此外,论文还利用了从单张图估计的单目深度来避免一些几何歧义性,例如凹陷面等问题。

然而,研究者认为,优化得到的纹理隐式场,难以完全重建出图片的纹理细节,例如小熊表面的绒毛纹和局部的颜色信息,在一阶段生成的结果中都没有体现。因此该方法提出聚焦于纹理精细化的二阶段优化过程。


在第二阶段,该方法根据第一阶段得到的几何模型,将参考图像的高质量纹理映射到 3D 空间中。然后着重于增强参考视角中被遮挡区域的纹理。为了更好地实现这一过程,该方法将一阶段的隐式表示导出到显式表示形式 —— 点云。与 Marching Cube 导出的噪声网格相比,点云可以提供更清晰的几何特征,同时也有利于划分遮挡区域和非遮挡区域。

随后,该方法聚焦于优化遮挡区域的纹理。点云渲染采用了基于 UNet 结构的 Deferred-Renderer (延迟渲染器),并同样使用来自预训练扩散模型的先验信息优化产生遮挡区域的精细纹理。

从左到右依次是参考图,一阶段优化得到的法向图和纹理渲染结果,二阶段纹理精细化后的渲染结果。


该方法还可以支持多种有趣的应用,包括可以对三维纹理进行自由编辑和风格化。以及用文本驱动产生复杂多样的三维内容。




结语


Make-It-3D作为首个将二维图片拓展到三维空间,同时保持了和参考图片相同的渲染质量和真实感的方法,致力于创作和二维图片视觉效果相同的三维内容。研究员们希望可以通过Make-It-3D这篇工作,引发学术界或工业界对于2D转3D这一方案更多的关注,加速三维内容创作的发展。对于方法的更多实验细节和更多结果,请详见论文内容和项目主页。

接下来就让我们轻松的Make-It-3D吧!




© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
2D到3D新突破!深度AIGC 技术剖析,一文看懂3D数据生成的历史及现状基于扩散模型的音频驱动说话人生成,云从&上交数字人研究入选ICASSP 2023Holiday Special 七月上 望七月 ~~ poem & song by 盈盈 & AP滴滴的分布式ID生成器,好用的一批!美国的路怒《心向阳光》&《光明》Asian MIT grad asks AI to make her photo more professional全球首个符合ASIL-D的车规级Chiplet D2D互连IP流片懂3D的语言模型来了!UCLA、上交、MIT等联合提出3D-LLM:性能大涨9%开源打败闭源?Meta即将推出开源代码生成平台Code Llama,剑指OpenAI Codex650亿参数,训练飙升38%!LLaMA基础大模型复刻最佳实践开源,GitHub已获30k星车载Chiplet D2D互连技术优势何在?Sisters Who Make WivesChina Floods: What’s the Cause, Why’s Rescue Been So Difficult?开源打败闭源?Meta 即将推出开源代码生成平台 Code Llama,剑指 OpenAI CodexESC中国之声丨基于中国人群队列研究,SGLT2i与新发晕厥风险显著降低相关7 Papers & Radios | LeCun世界模型首次尝试;Meta开源文本音乐生成模型Why China’s E-Bike Market Is Facing a Wave of Battery FiresMeta最新开源图形库IGL,star近2k,支持游戏开发、3D建模爆火DragGAN正式开源,GitHub近18k星!清华校友带GAN逆袭,大象一秒P转身The ‘Full-Time Kid’ Life Isn’t All It’s Cracked Up to Be中日美将俄的爱恨情仇小思考 |it’s ok哥大开发出AI智能体研究员,投喂题目瞬间生成研究报告,客观真实无幻觉,已经开源人人能用Luckin Sets Sights on China’s ‘Sinking Market’一次通过率73%,开源代码大模型WizardCoder超越最新GPT-4以外所有闭/开源模型Erklärung zur Zusammenarbeit我在养花的路上,越走越执着老地雷&高歌低吟《Help me make it through the night》一张图转3D质量起飞!GitHub刚建空仓就有300+人赶来标星超逼真3D生成模型!华南理工贾奎团队ICCV'23新作:支持重新照明、编辑和物理仿真GPT-Engineer一夜爆火!一个提示生成整个代码库,GitHub狂飙19k星Old Markets, New Appeal: Young Chinese Rediscover Wet MarketsTwitter推出私信限制,特斯拉FSD转移政策上线,美国七大AI公司做出承诺,安兔兔暗示将发布车机版,这就是今天的其他大新闻!A Scholar’s Search for Society’s Scapegoats双语 | Will China’s economy ever overtake America’s?回望广武看北京(赵逍关于《广武门 北京城》的创作谈)《原神》冰箱贴:神子&宵宫&申鹤&甘雨&刻晴&优菈&莫娜7位角色!3D AI生成出新玩法了:无需数小时,只要45秒,单张图片即可生成 3D模型【热夏生活随笔】Let Winter be Summer
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。