Redian新闻
>
Stable Diffusion 3 论文终于发布,架构细节大揭秘,对复现 Sora 有帮助?

Stable Diffusion 3 论文终于发布,架构细节大揭秘,对复现 Sora 有帮助?

公众号新闻

作者:张倩 文章来源:机器之心
Stable Diffusion 3 的论文终于来了!
这个模型于两周前发布,采用了与 Sora 相同的 DiT(Diffusion Transformer)架构,一经发布就引起了不小的轰动。
与之前的版本相比,Stable Diffusion 3 生成的图在质量上实现了很大改进,支持多主题提示,文字书写效果也更好了(明显不再乱码)。
Stability AI 表示,Stable Diffusion 3 是一个模型系列,参数量从 800M 到 8B 不等。这个参数量意味着,它可以在很多便携式设备上直接跑,大大降低了 AI 大模型的使用门槛。
在最新发布的论文中,Stability AI 表示,在基于人类偏好的评估中,Stable Diffusion 3 优于当前最先进的文本到图像生成系统,如 DALL・E 3、Midjourney v6 和 Ideogram v1。不久之后,他们将公开该研究的实验数据、代码和模型权重。
在论文中,Stability AI 透露了关于 Stable Diffusion 3 的更多细节。

论文标题:Scaling Rectified Flow Transformers for High-Resolution Image Synthesis

论文链接:https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf
架构细节
对于文本到图像的生成,Stable Diffusion 3 模型必须同时考虑文本和图像两种模式。因此,论文作者称这种新架构为 MMDiT,意指其处理多种模态的能力。与之前版本的 Stable Diffusion 一样,作者使用预训练模型来推导合适的文本和图像表征。具体来说,他们使用了三种不同的文本嵌入模型 —— 两种 CLIP 模型和 T5—— 来编码文本表征,并使用改进的自编码模型来编码图像 token。
Stable Diffusion 3 模型架构。
改进的多模态扩散 transformer:MMDiT 块。
SD3 架构基于 Sora 核心研发成员 William Peebles 和纽约大学计算机科学助理教授谢赛宁合作提出的 DiT。由于文本嵌入和图像嵌入在概念上有很大不同,因此 SD3 的作者对两种模态使用两套不同的权重。如上图所示,这相当于为每种模态设置了两个独立的 transformer,但将两种模态的序列结合起来进行注意力运算,从而使两种表征都能在各自的空间内工作,同时也将另一种表征考虑在内。
在训练过程中测量视觉保真度和文本对齐度时,作者提出的 MMDiT 架构优于 UViT 和 DiT 等成熟的文本到图像骨干。

通过这种方法,信息可以在图像和文本 token 之间流动,从而提高模型的整体理解能力,并改善所生成输出的文字排版。正如论文中所讨论的那样,这种架构也很容易扩展到视频等多种模式。
得益于 Stable Diffusion 3 改进的提示遵循能力,新模型有能力制作出聚焦于各种不同主题和质量的图像,同时还能高度灵活地处理图像本身的风格。
通过 re-weighting 改进 Rectified Flow
Stable Diffusion 3 采用 Rectified Flow(RF)公式,在训练过程中,数据和噪声以线性轨迹相连。这使得推理路径更加平直,从而减少了采样步骤。此外,作者还在训练过程中引入了一种新的轨迹采样计划。他们假设,轨迹的中间部分会带来更具挑战性的预测任务,因此该计划给予轨迹中间部分更多权重。他们使用多种数据集、指标和采样器设置进行比较,并将自己提出的方法与 LDM、EDM 和 ADM 等 60 种其他扩散轨迹进行了测试。结果表明,虽然以前的 RF 公式在少步采样情况下性能有所提高,但随着步数的增加,其相对性能会下降。相比之下,作者提出的重新加权 RF 变体能持续提高性能。
扩展 Rectified Flow Transformer 模型
作者利用重新加权的 Rectified Flow 公式和 MMDiT 骨干对文本到图像的合成进行了扩展(scaling)研究。他们训练的模型从带有 450M 个参数的 15 个块到带有 8B 个参数的 38 个块不等,并观察到验证损失随着模型大小和训练步骤的增加而平稳降低(上图的第一行)。为了检验这是否转化为对模型输出的有意义改进,作者还评估了自动图像对齐指标(GenEval)和人类偏好分数(ELO)(上图第二行)。结果表明,这些指标与验证损失之间存在很强的相关性,这表明后者可以很好地预测模型的整体性能。此外,scaling 趋势没有显示出饱和的迹象,这让作者对未来继续提高模型性能持乐观态度。
灵活的文本编码器
通过移除用于推理的内存密集型 4.7B 参数 T5 文本编码器,SD3 的内存需求可显著降低,而性能损失却很小。如图所示,移除该文本编码器不会影响视觉美感(不使用 T5 时的胜率为 50%),只会略微降低文本一致性(胜率为 46%)。不过,作者建议在生成书面文本时加入 T5,以充分发挥 SD3 的性能,因为他们观察到,如果不加入 T5,生成排版的性能下降幅度更大(胜率为 38%),如下图所示:
只有在呈现涉及许多细节或大量书面文本的非常复杂的提示时,移除 T5 进行推理才会导致性能显著下降。上图显示了每个示例的三个随机样本。

模型性能
作者将 Stable Diffusion 3 的输出图像与其他各种开源模型(包括 SDXL、SDXL Turbo、Stable Cascade、Playground v2.5 和 Pixart-α)以及闭源模型(如 DALL-E 3、Midjourney v6 和 Ideogram v1)进行了比较,以便根据人类反馈来评估性能。在这些测试中,人类评估员从每个模型中获得输出示例,并根据模型输出在多大程度上遵循所给提示的上下文(prompt following)、在多大程度上根据提示渲染文本(typography)以及哪幅图像具有更高的美学质量(visual aesthetics)来选择最佳结果。
以 SD3 为基准,这个图表概述了它在基于人类对视觉美学、提示遵循和文字排版的评估中的胜率。
 从测试结果来看,作者发现 Stable Diffusion 3 在上述所有方面都与当前最先进的文本到图像生成系统相当,甚至更胜一筹。
在消费级硬件上进行的早期未优化推理测试中,最大的 8B 参数 SD3 模型适合 RTX 4090 的 24GB VRAM,使用 50 个采样步骤生成分辨率为 1024x1024 的图像需要 34 秒。
此外,在最初发布时,Stable Diffusion 3 将有多种变体,从 800m 到 8B 参数模型不等,以进一步消除硬件障碍。
更多细节请参考原论文。
参考链接:https://stability.ai/news/stable-diffusion-3-research-pa






微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
剧本写作大揭秘,短剧受欢迎的原因找到了!强推!11个高中生值得参加的自然科学竞赛!还对「爬藤」有帮助......鸿发超市「2000 万美元」买下82街前Walmart超市!开设第4家Hông Phát分店!CEO正式跑路,“游戏人的第一个AI”Stable Diffusion濒临倒闭?Stable Diffusion老板也跑了!核心研发已集体辞职,“稳定AI”乱成一锅粥成就了Sora和Stable diffusion 3的DiTs,究竟是啥太可怕了!Tyler Perry 在见证 OpenAI 的 Sora 后,搁置了价值8亿美元的扩展计划揭秘党章女常霸城头实验:墙内篇-文学城党旗飘系列4-2 (长文慎入)北大发起复现Sora,框架已搭!袁粒田永鸿领衔,AnimateDiff大神响应发完最后一篇论文,Stable Diffusion核心团队全要离职了两年减掉一个成年人体重,美国女子减重教练分享11项有帮助的食品女儿听了一年的新闻栏目,对考试&写作都有帮助,现在入赠品多(明10点开团)保姆级 Stable Diffusion 教程,看完这篇就够了!Rufus 4.4发布,开源USB启动盘制作工具Makers工具箱主理人大揭秘,教你轻松掌握营销秘籍!!!!抛弃编码器-解码器架构,用扩散模型做边缘检测效果更好,国防科大提出DiffusionEdgeAPAD: close the stable door after the horse has bolted突发!Stable Diffusion老板也跑了!核心研发已集体辞职,已经unstable了...Stable Diffusion核心团队被曝集体离职;微软利用AI Agent复现Sora丨AIGC日报女儿听了一年的新闻栏目,对考试&写作都有帮助,现在入赠品多ACC与SBS能为华人小商家提供什么帮助?Open AI: Sora突发!Stable Diffusion 核心团队被曝集体离职天道有常女儿听了一年的新闻栏目,对考试&写作都有帮助,现在入赠品多|开团3D重建范式变革!最新模型MVDiffusion++:刷新视图合成和3D重建SOTA!微软“去OpenAI化”引发高层洗牌:必应CEO被DeepMind联创挤跑!纳德拉会见Stable Diffusion老板大模型时代,架构师如何玩转“AI+架构”?| ArchSummit海归精英集结广州!4.27广州海归招聘会岗位大揭秘,不要错过求职好机会!何枝可依與畫地為牢为什么西洋菜Watercress 才是最有营养的蔬菜Mixtral 8x7B论文终于来了:架构细节、参数量首次曝光猝死原因大揭秘,年轻人要警惕!【解码各大跨国公司股权架构】SHEIN、拼多多、海底捞股权架构大揭秘!外企社招丨Dräger德尔格,行业全球领导者,15薪,六险一金,多样福利,偏爱留学生大佬出走后首个发布!Stability官宣代码模型Stable Code Instruct 3B穿件羽绒服都有风险Stable Diffusion 3 API 发布!超越Midjourney v6和DALL-E 3
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。