Redian新闻
>
大语言模型击败扩散模型!视频图像生成双SOTA,谷歌CMU最新研究,一作北大校友

大语言模型击败扩散模型!视频图像生成双SOTA,谷歌CMU最新研究,一作北大校友

公众号新闻
白交 发自 凹非寺
量子位 | 公众号 QbitAI

语言模型击败扩散模型,在视频和图像生成上实现双SOTA!

这是来自谷歌CMU最新研究成果。

据介绍,这是语言模型第一次在标志性的ImageNet基准上击败扩散模型。

而背后的关键组件在于视觉分词器(video tokenizer) ,它能将像素空间输入映射为适合LLM学习的token。

谷歌CMU研究团队提出了MAGVIT-v2,在另外两项任务中超越了之前最优视觉分词器。

大语言模型击败扩散模型

已经形成共识的是,大语言模型在各个生成领域都有出色的表现。比如文本、音频、代码生成等。

但一直以来在视觉生成方面,语言模型却落后于扩散模型。

团队认为,其主要原因在于缺乏一个好的视觉表示,类似于自研语言系统,能有效地对视觉世界进行建模。与自然语言不同,人类会对视觉世界尚未演化出最佳的词汇。而这也限制了大语言模型的视觉生成能力。

基于这样的判断,这篇研究主要完成了三项工作:

  • 提出一种新的视觉tokenizer,在视觉生成、视频压缩以及动作识别都优于此前最优表现。

  • 一种全新无查找(lookup-free)的量化方法,可通过学习大量词汇来提高语言模型的视觉生成质量;

  • 首次有证据表明,在相同训练数据、等效模型大小和类似训练预算的条件下,语言模型在ImageNet上击败扩散模型。

据作者介绍,这也是视觉分词器首次成功地实现了与标准编解码器相媲美的效果。

在原有SOTA视觉tokenizerMAGVIT (Masked Generative Video Transformer)基础上,该方法主要完成了两种设计:无查找量化(Lookup-Free Quantization ,LFQ)以及图像-视频联合tokenizer。

最终在视频/图像生成,ImageNet 512×512和Kinetics-600,都优于Diffusion Model。

而在视频压缩、动作识别上,也优于以往的结果。

一作是北大校友

一作于力军目前是CMU计算机科学学院语言技术研究所博士生,师从Alexander G. Hauptmann教授,同时也是谷歌学生研究员。研究兴趣在于多模态基础模型,特别是多任务视频生成。

在来到CMU前,他在北大获得了计算机和经济学双学士学位。

在研究团队中也看到了其他不少华人面孔。

通讯作者蒋路,目前是谷歌研究院科学家以及CMU的兼职教授。

他的研究主要针对多模态大数据科领域,特别是鲁棒深度学习、生成式人工智能和多模态基础模型。

论文链接:
https://arxiv.org/abs/2310.05737
https://magvit.cs.cmu.edu/v2/

「量子位2023人工智能年度评选」开始啦!

今年,量子位2023人工智能年度评选从企业、人物、产品/解决方案三大维度设立了5类奖项!欢迎扫码报名 

MEET 2024大会已启动!点此了解详情


点这里👇关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
东北大学发布TechGPT2.0大语言模型ICLR'24 大语言模型智能体最新研究进展现代文明和近代中国 (前言)5138 血壮山河之武汉会战 信罗战役 11大语言模型真能“理解”语言吗?文生图prompt不再又臭又长!LLM增强扩散模型,简单句就能生成高质量图像|ACM MM'23大语言模型之生成/推理:参数与解码策略原理及其代码实现NeurIPS 2023 | 扩散模型再发力!微软提出TextDiffuser:图像生成的文字部分也能搞定!顶会过了!大语言模型融合最新SOTA方案NeurIPS 2023 | SlotDiffusion: 基于Slot-Attention和扩散模型的全新生成模型终结扩散模型,IGN单步生成逼真图像!UC伯克利谷歌革新LLM,美剧成灵感来源在图像、视频生成上,语言模型首次击败扩散模型,tokenizer是关键GPT-4+物理引擎加持扩散模型,生成视频逼真、连贯、合理狙击扩散模型!谷歌&伯克利提出IGN:单步生成逼真图像!文档字越多,模型越兴奋!KOSMOS-2.5:阅读「文本密集图像」的多模态大语言模型MIT惊人再证大语言模型是世界模型!LLM能分清真理和谎言,还能被人类洗脑如何判别大语言模型生成的文本?语言模型战胜扩散模型!谷歌提出MAGVIT-v2:视频和图像生成上实现双SOTA!独一无二的落水山庄视觉模型+大语言模型:首个支持10K+帧长视频理解任务的新型框架手机上0.2秒出图、当前速度之最,谷歌打造超快扩散模型MobileDiffusion微软提出KOSMOS-2.5,能阅读「文本密集图像」的多模态大语言模型易观分析:2023年AIGC产业研究报告-图像生成篇刷新多个SOTA!北大提出Video-LLaVA:超强视频语言大模型!ICCV 2023 | 基于预训练视觉语言模型和大语言模型的零样本图像到文本生成NeurIPS 2023 Spotlight | 半监督与扩散模型结合,实现少标签下可控生成谷歌新作UFOGen:通过扩散GAN实现大规模文本到图像生成科研上新 | 第2期:可驱动3D肖像生成;阅读文本密集图像的大模型;文本控制音色;基于大模型的推荐智能体大模型免微调解锁对话能力,RLHF没必要了!一作上交大校友:节省大量成本和时间大模型生成提速2倍!单GPU几小时搞定微调,北大数院校友共同一作丨开源《情恋草原》&《思念成风》哈工大发布大模型思维链推理综述:200+文献全面解析大语言模型思维链推理最新进展妄想症房客被抓走,我还被告了华为提出Sorted LLaMA:SoFT代替SFT,训练多合一大语言模型生成式 AI 与大语言模型时代的 NVIDIA GPU 生态 | NVIDIA 解决方案与架构技术总监张瑞华演讲预告
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。