Redian新闻
>
最懂中国传统文化的AI绘画模型,画作有形更有神,传达儒释道思想

最懂中国传统文化的AI绘画模型,画作有形更有神,传达儒释道思想

公众号新闻

机器之心专栏

机器之心编辑部

多模态预训练模型与图像生成技术的结合让 AI 更智能、更有文化。


最近 AI 作画火爆出圈,国内外掀起了一波 AI 绘画热潮,各种社交媒体上用 AI 绘画模型生成的各种图片屡见不鲜。上个月,一位游戏设计师用 AI 作画工具 Midjourney(中途)创作的作品《太空歌剧院》获得了美国科罗拉多州博览会艺术比赛的金奖。


受此启发,中国人民大学卢志武教授团队将自身研发的多模态预训练模型文澜与最新的图像生成技术进行创新结合,打造了一款最懂中国传统文化的 AI 绘画生成模型


文澜模型是中国人民大学高瓴人工智能学院执行院长文继荣教授、卢志武教授、宋睿华长聘副教授等领衔研发的大规模中文多模态预训练模型。文澜模型经过 6.5 亿弱相关中文图文对的预训练,学习到独特的中文语义理解能力并能很好地将中文语义与视觉信息联系起来,尤其擅长读取中文独有的含蓄语义与图片中的抽象概念。


今年 6 月,相关研究成果 “Towards artificial general intelligence via a multimodal foundation model” 已经发表在 Nature Communications(《自然 · 通讯》)上。


论文链接:https://www.nature.com/articles/s41467-022-30761-2


文澜与生成模型的结合


该研究团队通过挖掘文澜模型的潜力,将其与最新的生成技术进行创新性的结合,融合文澜的抽象语义理解能力与生成模型的强大生成能力,确保得到的模型能够出色地解读输入文本的语义并生成具有对应语义的图片。


团队专注于挖掘文澜在中国传统文化上的潜力,借用最新的生成模型架构,并在所搜集的国画数据集上进行训练,得到的模型能根据输入文本生成对应风格的图片。详细架构图如下所示。


具体来说,团队在国画数据集上训练了一个无条件生成模型,并通过迭代生成的方式用文澜模型对生成过程进行引导。


该方法首先随机初始化一张噪声图片。在每一步生成中,模型都会将生成的图片沿着与输入文本接近的方向调整生成图片的内容,使得每一步生成的图片内容与输入文本在文澜模型的隐空间中趋于一致。该步骤可描述为:


其中 x 和 y 分别表示图片和文本,IE 和 TE 分别表示文澜的图片编码器和文本编码器。通过不断迭代,该模型能够实现根据文本语义生成高质量符图片的功能。


文澜绘画模型的评测结果


由于文澜模型本身的特点,文澜绘画模型能够根据输入的中国古诗词生成对应的图片。从下述的例子可以看出,模型生成的图片与古诗词的内容和意境都非常契合。


同时,团队还发现文澜绘画模型甚至对晦涩难懂的儒释道思想也有独到的解读,生成的 AI 绘画作品获得了王阳明心学研究专家姜洋教授的高度认可


为了更好地展现文澜绘画模型在解读儒释道思想上的特色,团队挑选了国内外最热门的 AI 绘画模型进行对比分析,包含盗梦师、文心、Disco Diffusion、Midjourney 和 Stable Diffusion。其中对 Disco Diffusion、Midjourney 和 Stable Diffusion 而言,中文文本需要先经过百度翻译。


首先在儒家思想方面,团队挑选了王阳明心学的三句代表性话。从下图生成的结果来看,盗梦师、Disco Diffusion、Midjourney 和 Stable Diffusion 偏向于生成句子中的一些具象物体或者生成一些画面较好但内容与句子并无太大关系的图片。文心则是倾向于生成带有人物的图片,甚至将光明直接对应成点燃的蜡烛。


而文澜绘画模型能够更好地读取整句话的意思以及其中蕴含的儒家思想,从而生成更契合该思想的图片。

 

文澜解读儒家思想。

其次对于含有释家思想的文本输入,目前最火的绘画生成模型均只能抓住其中的一些具象物体并进行针对性生成,有的绘画模型甚至有可能误解其中的思想。


如下图生成结果所示,文心将 “见道忘山者人间亦寂也,见山忘道者山中也喧也” 理解成道家的思想(生成了一个道士的形象)。文澜绘画模型则很好地解读输入文本的释家思想并将之反映在生成的图片中。

 

文澜解读释家思想

最后在道家思想方面,团队挑选了道德经中最核心的三句话。文心相对于盗梦师、Disco Diffusion、Midjourney 和 Stable Diffusion,对道德经有较好的解读能力。


但整体来说,文澜绘画模型对道家思想解读得更加到位,生成的图片更具有道家的意境。


文澜解读道家思想

总结


文澜团队将近期大火的 AI 绘画生成技术与中文多模态预训练模型文澜相结合,深度挖掘文澜模型在中国传统文化上的潜力,并通过生成模型以图片的形式展现出来,从而让普通大众对一些深奥的中国传统文化思想有了更直观的了解。



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
有形式感的设计。中国文化的深层结构:看透传统社会最难触碰的秘密COACH兔年限量版,最懂中国红为传统文化注入年轻态,优酷《闪耀吧!中华文明 》如何带动文化精品创作再升级?欢乐春节:iSING!SUZHOU“唐诗的回响”新春音乐会将在美首演——开启2023中国传统新年庆祝活动的序幕当江南园林遇上春节档,和平精英是如何为传统文化打开新视角的?丢人丢到塞尔维亚?这锅,“中国传统”不背!江疏影怒怼韩国网友:看了它,才懂中国人的文化底气敦煌里的色彩美学,“中国传统色”系列新作,跨越千年的视觉盛筵!|种草机特朗普生命中最重要的女人(多图)没有形成这种价值观的人,不值得交往低价开团丨中国传统节日绘本4册只要9.9元,让孩子更了解中国的传统文化一隅茶室,一隅禅意,让更多传统文化走进我们的生活中国传统文化——世上最厉害的算命!太透彻了“十八数藏”通过数字化助力打破非遗传承保护瓶颈,激活传统文化新魅力市政府党组会议传达学习党的二十大和二十届一中全会精神,努力当好全面建设社会主义现代化国家的排头兵它被称作中国传统“瑞士卷”,我家连吃了3次!补铁解馋,一整锅都剩不下最懂中国足球的人,平均年龄59岁加斯佩半岛自驾 (七)佛罗伦国家公园 (Forillon National Park)小狐《多伦多有条羊街》9. 那个骚气的男人疲劳双眼的“回春药”!每天15分钟,视力好、眼袋消、眼睛更有神!华扬联众:当中国传统文化遇到元宇宙当着她面说:将保持与中国传统友好关系AI首次超越人类!腾讯、阿里的NLP模型,比你更懂中文王蒙 | 天地人生——中华传统文化十章饮料史上最智商税的产品,坑传统文化的凉白开如何借助传统文化,打造爆款IP?市委常委会会议传达学习习近平总书记重要讲话精神,研究部署全市学习宣传贯彻党的二十大精神相关工作一位教师的忧虑:“传统文化进校园”,似乎哪里出了问题?秦晖:传统文化是什么?AI画画模型成本被打下来了!预训练成本直降85%,微调只需单张RTX 2070,这个国产开源项目又上新了命运没有形状,但有重量 | 人间日签中国传统文化最严重的两个缺失加斯佩半岛自驾 (七)佛罗伦国家公园 (图)
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。