Redian新闻
>
阿里50亿参数AI画画模型火了!将图像拆分再自由重组,达摩院副院长率队打造

阿里50亿参数AI画画模型火了!将图像拆分再自由重组,达摩院副院长率队打造

公众号新闻
明敏 发自 凹非寺
量子位 | 公众号 QbitAI

AI画画通用模型,新增一员大将!

由阿里达摩院副院长周靖人等人打造的可控扩散模型Composer,一经发布就小火了一把。

这个模型由50亿参数训练而来,和Stable Diffusion原理不同。

更进一步把训练图像拆解成了多个元素,然后基于这些元素训练扩散模型,让它们能够灵活组合。

由此一来,模型的创造能力就比仅基于图像大很多。

如果有100张能拆分成8个元素的图像,那么就能生成一个数量为100的8次方的结果组合。

网友们看了纷纷表示,AI画画发展速度也太快了!

团队表示,模型的训练和推理代码都在路上了。

有限手段的无限使用

该框架的核心思想是组合性(compositionality),模型名字就叫做Composer

观察到现下很多AI画画模型,在细节的可控性上还没有做到很好,比如准确改变颜色、形状等。

研究团队认为,想要实现图像的可控生成,不能依赖于对模型的调节,重点应该放在组合性上,这种方式可以将图像的创造力提升到指数级。

引用语言学大师诺姆·乔姆斯基的经典语录来解释模型,就是:

有限手段的无限使用。

具体来看,该模型就是将每个训练图像拆解成一系列基础元素,如蒙版图、草稿图、文字描述等,用它们来训练一个扩散模型。

然后让这些被拆分的元素,在推理阶段灵活组合,生成大量新的图像输出。

它可以支持多种形式作为输入。比如文字描述作为全局信息,深度图和草图作为局部引导,颜色直方图为低级细节等。

在保证生成图像可控的基础上,作为一个通用框架,该模型还能不用再训练就可以完成大量经典生成任务。

举例来看,图(a)中,最左边的是原图,后面4个是通过对Composer不同子集的表示进行调节而生成的新结果。

图(b)展示的是图像插值的结果。

图像重构的话是酱婶儿的,Composer能够简单地改变图像表示来重新配置图像,比如草稿图和分割图。

还有对图像的特定部分进行编辑。

比如给蛋糕派换口味、把珍珠耳环少女的脸换成梵高、让兔子长一张熊猫脸等。

比较经典的图像生成任务也能挑战,而且无需再训练。


团队表示,现有成果还存在一定局限性,比如在单一条件输入的情况下,生成效果不是很好。以及输入不同语义的图像和文本嵌入时,生成结果会降低对文本嵌入的权重。

而针对AI画画模型都需要面对的风险问题,团队表示为避免被滥用,他们会在公开模型前先创建一个过滤版本。

达摩院副院长带队

该研究由阿里及蚂蚁团队完成。

通讯作者为周靖人

他现任阿里达摩院副院长、阿里云智能CTO,是IEEE Fellow。

2004年于哥伦比亚大学获得计算机博士学位,后加入微软担任研发合伙人。

2015年,周靖人加入阿里巴巴集团,先后负责过达摩院智能计算实验室、大数据智能计算平台、搜索推荐事业部等。

论文一作Huang Lianghua同样来自达摩院,研究方向为扩大模型规模和数据来表示学习和内容生成。

论文地址:
https://arxiv.org/abs/2302.09778

GitHub地址:
https://github.com/damo-vilab/composer

《中国AIGC产业全景报告暨AIGC 50》调研启动

谁会是中国的“ChatGPT”?最有竞争力和潜力的AIGC力量位于何方?

量子位《中国AIGC产业全景报暨AIGC 50》正式启动对外征集,期待有更多优秀的机构、产品、案例与技术能够被大众看到。


点这里👇关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
两会声音|全国人大代表、江苏省电子信息产品质量监督检验研究院副院长吴兰:建立“链主”企业培育机制预言未来!阿里巴巴达摩院发布2023十大科技趋势AAAI 2023 Oral | 图像质量堪忧干扰视觉识别,达摩院提出更鲁棒框架10天内我国痛失20位两院院士!原中科院副院长王佛松逝世,享年89岁瑞金医院副院长胡伟国撰文:我对父亲的亏欠该如何报答想起我爸杭州内推 | 阿里达摩院城市大脑实验室招聘三维计算方向研究型实习生瞭望专访第十四届全国政协委员、最高人民法院副院长沈亮医院副院长主动投案,党委书记第二天被查动态|郭雳任北京大学法学院院长,朴文丹、车浩、刘哲玮、戴昕任副院长著名俄罗斯问题专家、复旦大学国际关系研究院副院长冯玉军对俄乌战争的看法轰动全国!这个“忽悠”马云10亿的男人,如今还阿里5000亿如何判断此番是否“境外势力”作祟的办法:老大用自己做“诱饵”已致29人遇难!长峰医院事故初步调查结果公布!院长、副院长等12人被刑拘阿里达摩院开源:半监督学习框架Dash,刷新多项SOTA!AAAI 2023 Oral | 图像质量堪忧干扰视觉识别!达摩院提出RTS:鲁棒性特征建模框架王小川官宣大模型创业!5000万美元启动资金,年中发布首个产品,目前在训500亿参数版本10天内我国痛失20位两院院士!原中科院副院长王佛松逝世最新发布!29人遇难!院长、副院长等12人已被刑拘!初步调查:医院内部施工作业火花引发阿里达摩院2023十大科技趋势重磅发布:Chiplet、生成式AI榜上有名超高分论文!视觉新范式!COCs:将图像视为点集邓小平在起落中如何使用汪东兴说“在一周内6名院士去世”是正常的,看看这张图?妈妈能否熬过这一关已致29人遇难!长峰医院事故初步调查结果公布!院长、副院长等12人被刑拘,公司股票今日停牌包工头涉嫌“敲诈”高院副院长及商人前夫案始末原达摩院大模型 M6 带头人杨红霞加入字节,语言生成大模型再迎新玩家突发!阿里云高层大调整,集团CEO张勇兼任阿里云总裁,张建锋专职达摩院阿里版ChatGPT已进入测试!中文聊天截图曝光,达摩院出品中央指导组组长率队在地方开展调研推进证券交易所公司制改革,逐步提高交易所自主权,全国人大代表、清华大学五道口金融学院副院长田轩接受每经专访彭博推出BloombergGPT——专为金融行业从头打造的500亿参数大语言模型AAAI 2023 | 图像质量堪忧干扰视觉识别,达摩院提出更鲁棒框架GPT-3剪枝算法来了!无需微调,1750亿参数模型剪50%还提点视觉版ChatGPT来了!吸收AI画画全技能,MSRA全华人团队打造,微软16年老将领衔
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。