Redian新闻
>
达摩院发布大模型测试基准:GPT-4勉强及格,其他模型悉数落败

达摩院发布大模型测试基准:GPT-4勉强及格,其他模型悉数落败

公众号新闻

机器之心专栏

机构:达摩院多语言NLP
阿里巴巴达摩院多语言 NLP 团队发布了首个多语言多模态测试基准 M3Exam,共涵盖 12317 道题目。

随着大模型的发展,尤其是近来各种开源大模型的发布,如何对各种模型进行充分并且准确的评估变得越来越重要。其中一个越来越受到认可的方向就是利用人类考题来检验模型,从而可以测试模型的知识及推理能力。例如对于英文模型,MMLU 已经被广泛用来评估模型在多个学科上的表现。类似的,最近中文社区也涌现了例如 C-Eval 以及 GAOKAO 这种利用中文试题来测试模型,特别是中文模型的表现。


这样的测试基准对于促进模型的发展起着至关重要的作用,然而对于多语言 / 多模态大模型,相应的评测依然是一片空白。由此,阿里巴巴达摩院多语言 NLP 团队发布了首个多语言多模态测试基准 M3Exam 以推动此类评测的发展,论文和数据代码已公开:


  • 论文:https://arxiv.org/pdf/2306.05179.pdf
  • 数据 & 代码:https://github.com/DAMO-NLP-SG/M3Exam

背景

传统的 NLP 任务已经越来越难充分测试大语言模型的真正效果,在这样的背景下,利用人类考题来检验模型已经逐渐成为了测试大模型的一个常见做法。例如 MMLU 数据集涵盖了多个学科,被广泛用来测试各种模型,GPT-4 也将其作为一个重要的测试基准。类似地,最近一个月我们也看到了中文上的类似尝试例如 C-Eval 和 GAOKAO,将各类 / 高考的中文试题汇总起来用以测试中文大模型。

然而目前的测试基准都仅有英文或者加上中文问题,尽管许多模型涌现 / 宣称有多语言的效果,模型的多语言能力无法得到充分测试。此外,多模态类问题,也即涉及图片的考题也往往在构建过程中被忽略。这导致了多语言 / 多模态大模型的效果无法被准确衡量。为了弥补这一空白,我们构建了 M3Exam - 一个利用人类考题构建的多语言、多模态、多级别的测试基准,共涵盖 12317 道题目。


正如名字所示,M3Exam 有三个特征:

  • Multilingual 多语言:我们综合考虑语言特点、资源高低、文化背景等多个因素,挑选了 9 个国家对应的语言,涵盖英文、中文、意大利语、葡萄牙语、越南语、南非荷兰语、斯瓦希里语、泰语、爪哇语,所有问题均来自于对应国家的官方试题。
  • Multimodal 多模态:我们同时考虑纯文字以及带图片的题目,并且认真处理了所有图片从而方便模型进行处理。
  • Multilevel 多阶段:我们考虑三个重要的教育阶段:小升初、初升高、高中毕业,并且从对应阶段的官方考试取得题目,使得可以比较不同阶段对应的不同智力要求下,模型的表现差异。

多语言测试

我们选取了多种开源、闭源模型来测试它们的多语言能力,结果如图所示:


可以看到虽然许多模型的英文效果不错(比如 Claude 和 ChatGPT 都可以达到 75% 左右),但平均而言效果均不佳。GPT-4 是唯一一个可以超过 60% 准确率的模型,而 ChatGPT 也只能达到 57% 的准确率。从语言的角度看,在低资源或者非拉丁字符语言比如泰语、爪哇语上,即使是 GPT-4 也只能达到 50+% 的准确率。这显示目前大部分模型的能力仍然是集中体现在英文上,多语言能力仍然有待提高。

我们同样可以看到,来自于各个国家本土的问题更加充分地测试出了模型的多语言能力。例如 GPT-4 的 report 里将 MMLU 翻译成了多个语言,在不同语言的翻译试题上取得了较好的结果。但是如果用真实场景下的问题,这迫使模型必须学习到每个语言,甚至是其背后对应的文化背景知识,才能解答。例如上图中给的例子,斯瓦希里语涉及到一个谚语的填空;泰语则涉及到泰国本地常见的自然景观特点:


可以看到,即使是根据准确的翻译(上图的英文翻译由泰语母语者提供),但没有对应的语言、文化常识也无法作答,体现出对模型多语言能力的充分测试。

多模态测试

我们也选取了多个多模态大模型并对其进行测试,包括 Fromage, OpenFlamingo, BLIP-2, InstructBLIP,结果如下图所示:


可以看到,大部分模型表现都很糟糕,甚至没有模型可以超过 50% 的准确率。即使跟相近参数量的 Flan-T5 模型相比(Flan-T5 并没有拿图片当作输入),多模态模型基本没有体现出优势。

进一步检查我们发现,可能是因为现有的多模态测试数据都比较简单,例如 VQA 中往往只是对图片的某一方面进行简单提问。而人类考题往往涉及到对图片更复杂的理解,例如数理类考试中需要注意到图片的数字细节。下图给了一个具体问题以及各个模型的输出:


可以看到所有模型均回答错误。为了进一步检验模型对图片理解的程度,我们额外构造了一个 prompt 让模型对图片的各种细节进行描述(上图右边),可以看到所有模型都无法准确描述出图片里标注的角度 65 度,所以自然无法解答出图中的反射角是多少度。

多层级测试

在数据构造过程中,我们选取了三个重要的考试阶段,即小升初、初升高、高中升大学。值得注意的是我们发现即使各个国家的教育体系各有差异,但基本都有相应的教育阶段。不同的教育阶段往往对应着在不同国家,大家对相应年龄段人群所期待的智力水平。这样的划分给我们提供了用不同教育阶段的问题来观察模型效果的角度。结果汇总如下图所示:


可以看到出人意料的是,从较低的教育阶段到更高阶段,模型效果并没有呈现显著下降。奇怪的是基本所有模型都在中等阶段的问题上表现最好。然而对于人类来说,例如在中国,如果能在高考中得到 70% 左右的正确率,解决小学考题应该是轻而易举的事情,然而对模型来说似乎并不如此。

这个观察给我们带来的启发是,不断用更困难的数据去测试模型不一定能最大限度衡量出模型的差异。如果想要可靠地在实际生活中使用模型,例如用于 AI 教育,研究为什么模型会在基础问题上犯错可能更有价值。

结语

这篇文章介绍了我们新创建的测试基准 M3Exam,目标是可以为多语言 / 多模态大模型的评价提供一个可靠的基准。从目前的测试结果我们可以看出,虽然不少模型在高资源语言例如英文甚至中文上已经可以取得还不错的效果,但在多语言情况下绝大部分模型的效果都差强人意。多模态模型的效果则更难令人满意,显示目前的多模态模型还只能对图片的简单特征进行捕捉,而无法捕捉更精确的细节。我们期待 M3Exam 未来可以帮助相关模型的开发迭代,从而将大模型的便利带给所有语言的使用者以及更丰富的使用场景。


对达摩院多语言NLP组研究感兴趣的读者,可以扫描以下二维码加入交流群。





© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
大模型剑指AI Agents,达摩院推出Dialogue Agents新基SpokenWOZ1300亿参数,国内首个数学大模型MathGPT上线!多项基准赶超GPT-4GPT-4取代数据分析师,成本仅3000!阿里达摩院&NTU论文引热议日本公布水质检测结果,中国人造太阳取得重大进展,X(推特)上线招聘平台,智己汽车发布大模型,这就是今天的其他大新闻!OpenAI被曝将发布全新开源大模型,网友:GPT平替?年薪60万的数据分析师工作保不住了?!阿里达摩院研究发现,改用GPT-4成本只需几千元2023“雷军年度演讲”在今晚7点举行;讯飞星火位列国产主流大模型测评榜首位|绿研院日报当LLM遇到Database:阿里达摩院联合HKU推出Text-to-SQL新基准​独家 | 原达摩院大牛金榕系因阿里大模型纷争离职,近日加入 Meta阿里达摩院免费开放100件AI专利;字节推出大模型MBTI测试结果;ChatGPT自定义功能扩展免费丨AIGC大事日报“阿里达摩院专家被裁”传言不实!信息发布者道歉阿里达摩院:GPT-4替代年薪60万的数据分析师只要几千块,论文已发5064 血壮山河之武汉会战 鏖战幕府山 33大大是条大灰狼最新大模型排名!中文大模型评测基准SuperCLUE发布6月榜单ACL 2023 | GLUE-X:基于分布外泛化的自然语言理解模型测试集“超越”(MMCU)中文通用大语言模型测试集--国内首个多领域多任务数据集GPT作文能力比拼:GPT3.5、GPT4、百度文心一言、讯飞星火美国人民银行中科院发布多模态 ChatGPT,图片、语言、视频都可以 Chat ?中文多模态大模型力作浪潮信息:发布大模型智算软件栈OGAI,为大模型创新打造高效生产力达摩院猫头鹰mPLUG-Owl亮相:模块化多模态大模型,追赶GPT-4多模态能力上海发布大模型政策,打造AI“模”都;罗永浩“曲线上市”成功;华为云正式发布盘古大模型3.0……「成熟」大模型才能涌现?MIT:GPT-4能自我纠错代码,GPT-3.5却不行阿里达摩院:GPT-4替代年薪60万数据分析师只要几千块GPT-4能否取代数据分析师?达摩院的初步实验为你解答~阿里回应达摩院自动驾驶裁员70%,曝威马海口门店全部关停,闲鱼收取服务费,iPhone15生产或将延迟,这就是今天的其他大新闻!阿里达摩院大模型公开课上新!主讲中文个性化对话大模型ChatPLUG和模块化多模态大模型mPLUG-Owl达摩院加入AI抢人大战;薇娅公司发布AI数字人直播业务;中国电信正深研通用大模型丨AIGC大事日报连GPT-4都考不及格,17个大模型悉数落败,因果推理太难了阿里达摩院:GPT-4 的成本只有高级数据分析员的 0.45%从max{发展,其他} 到max{安全,发展,其他}核磁共振仪价格暴跌10倍,只因国产取得突破,欧美的好日子到头了给语言大模型加上综合视听能力,达摩院开源Video-LLaMA两首合唱:《赤伶》&《是否》
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。