Redian新闻
>
首个中文原生DiT架构!腾讯混元文生图大模型全面开源,免费商用

首个中文原生DiT架构!腾讯混元文生图大模型全面开源,免费商用

公众号新闻
机器之心报道
机器之心编辑部

中文 AI 社区迎来了一个好消息:与 Sora 同架构的开源文生图大模型来了!

5 月 14 日,腾讯宣布旗下混元文生图大模型全面升级并全面开源,目前已在 Hugging Face 平台及 GitHub 上发布,包含模型权重、推理代码、模型算法等完整模型,可供企业与个人开发者免费商用。


  • 官网地址:https://dit.hunyuan.tencent.com/
  • GitHub 项目地址:https://github.com/Tencent/HunyuanDiT
  • Hugging Face 模型地址:https://huggingface.co/Tencent-Hunyuan/HunyuanDiT
  • 技术报告地址:https://tencent.github.io/HunyuanDiT/asset/Hunyuan_DiT_Tech_Report_05140553.pdf
 
据了解,这是业内首个中文原生的 DiT 架构文生图开源模型,支持中英文双语输入及理解,参数量 15 亿。

升级后的混元文生图大模型采用了与 Sora 一致的 DiT 架构,即全新的 Hunyuan-DiT 架构,不仅可以支持文生图,也可以作为视频等多模态视觉生成的基础。


为了全面比较 Hunyuan-DiT 与其他文生图模型的生成能力,腾讯混元团队构建 4 个维度的测试集,邀请超过 50 名专业评估人员进行评估,包括文本图像一致性、排除 AI 伪影、主题清晰度、审美

从下表结果可以看到,采用 Hunyuan-DiT 架构的腾讯混元文生图模型效果远超开源的 Stable Diffusion 模型,是目前效果最好的开源文生图模型,整体能力属于国际领先水平。

与其他 SOTA 模型的比较。

与这些 SOTA 模型的定性比较结果如下图所示。




全新 DiT 架构
腾讯混元文生图要做开源模型 No.1
 
大模型的优异表现,离不开领先的技术架构。

升级后的腾讯混元文生图大模型采用了全新的 DiT 架构(DiT 即 Diffusion With Transformer),这是 OpenAI Sora 和 Stable Diffusion 3 的同款架构和关键技术,是一种基于 Transformer 架构的扩散模型。
 
过去,视觉生成扩散模型主要基于 U-Net 架构,但随着参数量增加,基于 Transformer 架构的扩散模型展现了更好的扩展性,有助于进一步提升模型生成质量及效率。Sora 很好地说明了这一点。

腾讯混元是业界最早探索并应用大语言模型结合 DiT 结构的文生图模型之一。从 2023 年 7 月起,腾讯混元文生图团队就明确了基于 DiT 架构的模型方向,并启动了新一代模型研发。今年初,混元文生图大模型已全面升级为 DiT 架构。

Hunyuan-DiT 的模型结构如下图 7 所示,采用了创新的网络架构,结合了双语 CLIP 和多语言 T5 编码器,通过精心设计的数据管道进行训练和优化,支持多轮对话,能够根据上下文生成并完善图像。


在 DiT 架构之上,腾讯混元团队支持了中英双语文本提示生成图像,并在算法层面优化模型的长文本理解能力,能够支持最多 256 字符的内容输入,达到行业领先水平。


此外,混元文生图大模型在算法层面创新实现了多轮生图和对话能力,可实现在一张初始生成图片的基础上,通过自然语言描述进行调整,从而达到更满意的效果。


更多多轮对话生成示例如下图所示。


中文原生也是腾讯混元文生图大模型的一大亮点。此前,像 Stable Diffusion 等主流开源模型核心数据集以英文为主,对中国的语言、美食、文化、习俗都理解不够。

作为首个中文原生的 DiT 模型,混元文生图具备了中英文双语理解及生成能力,在古诗词、俚语、传统建筑、中华美食等中国元素的生成上表现出色。我们可以看以下一些生成示例。


腾讯混元文生图还更擅长细粒度文本提示生成


评测结果显示,新一代腾讯混元文生图大模型视觉生成整体效果,相比前代提升超过了 20%,不仅在语义理解、画面质感与真实性方面全面提升,而且在多轮对话、多主体、中国元素、真实人像生成等场景下效果提升显著。

这一次
腾讯混元选择全面开源文生图模型
 
腾讯混元文生图能力,已经广泛被用于素材创作、商品合成、游戏出图等多项业务及场景中。今年初,腾讯广告基于腾讯混元大模型,发布了一站式 AI 广告创意平台腾讯广告妙思,可为广告主提供文生图、图生图、商品背景合成等多场景创意工具,有效提高了广告生产及投放效率。

腾讯混元文生图大模型的开源,填补了中文原生 DiT 文生图架构的缺失,有助于更多的开发者和创作者参与进来,一起探索、共创基于 DiT 架构的视觉生成生态,更好地去验证、挖掘这个技术架构的潜力。
 
腾讯文生图负责人芦清林表示:「腾讯混元文生图的研发思路就是实用,坚持从实践中来,到实践中去。此次把最新一代模型完整开源出来,是希望与行业共享腾讯在文生图领域的实践经验和研究成果,丰富中文文生图开源生态,共建下一代视觉生成开源生态,推动大模型行业加速发展。」
 
基于腾讯开源的文生图模型,开发者及企业无需从头训练,即可以直接用于推理,并可基于混元文生图打造专属的 AI 绘画应用及服务,能够节约大量人力及算力。透明公开的算法,也让模型的安全性和可靠性得到保障。
 
此外,基于开放、前沿的混元文生图基础模型,也有利于在以 Stable Diffusion 等为主的英文开源社区之外,丰富以中文为主的文生图开源生态,形成更多样原生插件,推动中文文生图技术研发和应用。



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
腾讯混元文生图大模型开源:Sora 同架构,更懂中文,已支持 16s 视频生成OpenAI或将在5月9日发布ChatGPT版搜索引擎;中文大模型最新排名出炉,腾讯混元位居前三丨AIGC日报深圳/北京内推 |​ 腾讯混元AIGC团队招聘文生3D方向算法研究员/实习生快手上线自研文生图大模型“可图”,参数规模达十亿级AI早知道|360安全大模型3.0发布;通义听悟上线音视频问答助手;腾讯混元大模型参数规模扩展至万亿老公一个最好的朋友的太太,嫉妒心有的。AI早知道|OpenAI发布GPT-4o;混元文生图大模型宣布全面开源阿里通义千问 GPT-4 级主力模型降价 97%,百度文心两大模型全面免费打磨三年、支持万亿 MoE,腾讯混元模型团队的真实推理实力到底如何?腾讯混元大模型产品品鉴会邀约 | 7月3日16:00 一起来体验混元大模型的全新产品方案AI早知道|Stability AI 资金危机或考虑出售;腾讯混元大模型支持 16s 视频生成元象首个多模态大模型 XVERSE-V 开源,刷新权威大模型榜单,支持任意宽高比输入AI早知道|腾讯混元文生图大模型开源训练代码;知网推出AI学术研究助手4.00门槛免费商用!孟子3-13B大模型正式开源,万亿token数据训练childhood dreams - Bouguereau\'s art开源日报 | 微软AI程序员登场,马斯克开源Grok;Open-Sora全面开源双林奇案录第三部之校园疑案: 第二十六节百度宣布文心大模型两大主力模型全面免费腾讯研发了快一年的混元文生图模型,说开源就开源了?国产多模态大模型开源!无条件免费商用,性能超Claude 3 Sonnet[旅游] Día de la Independencia | 2017年9月游墨西哥城第3-4天iPhone 和 iPad 将升级眼球追踪功能;字节豆包大模型全面开启商业化;蔚来第二品牌发布首款新车 | 极客早知道大模型技术狂飙!全面剖析大模型全链路技术,顶级专家带你突破瓶颈腾讯混元文生图大模型全面开源!Sora同架构,更懂中文,免费商用腾讯混元大模型全面降价!混元-lite 即日起免费揭秘腾讯混元大模型:400+场景落地,协作SaaS产品全面接入苹果一次性开源了8个大模型! 包含模型权重、训练日志和设置,OpenELM全面开源周线开始盘整,大盘有回调的需要超越扩散模型!度小满、中科大等联合提出全新自回归通用文生图模型腾讯混元、北大发现Scaling law「浪涌现象」,解决学习率调参难题腾讯混元大模型升级:部分中文能力已追平GPT-4,支持16s视频生成;索尼音乐禁止人工智能开发商使用其音乐内容丨AIGC日报小镇如钟,分秒如诉32专家MoE大模型免费商用!性能全面对标Llama3,单token推理消耗仅5.28%AI早知道|商汤发布日日新5.0大模型;微软推出小语言模型Phi-3;腾讯旗下协作SaaS产品全面接入混元大模型AI早知道|元象开源首个多模态大模型XVERSE-V;信通院发布国内首个汽车大模型标准
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。