Redian新闻
>
GPT-4满分通过MIT本科数学考试!这套提示词火了

GPT-4满分通过MIT本科数学考试!这套提示词火了

公众号新闻
衡宇 发自 凹非寺
量子位 | 公众号 QbitAI

万万想不到啊,MIT数学考试,被GPT-4攻破了?!

突然有人在最新论文工作中高调宣布:

GPT-4在MIT的数学和EECS(电气工程和计算机科学系)本科学位考试中,表现出的能力完全满足毕业要求

而且妥妥地拿下满分

要知道,测出这个结果的不是别人,正是来自MIT和波士顿大学、康奈尔大学的研究团队。

而且强如上一代王者GPT-3.5,在同样的测试中,只成功搞定了三分之一。

GPT-3.5考试成绩

论文一出,无数目光迅速被吸引过来。

GPT-4这样看似开挂的行为,自然引发了不少网友的感慨。

比GPT-3.5强好多,好耶!

咱就是说,有没有可能以后不需要比GPT-4更强的模型,来解决学术问题了?

还有网友展现了自己网上冲浪的“前沿性”,玩了个这两天Yann LeCun吐槽“GPT-4智商不如狗”的梗:

GPT-4开挂MIT考试

具体来说,GPT-4这次是参与了这样一场测试:

研究团队策划了一个数据集,其中包含4550个问题和解决方案。

这4550个问题和解决方案,来自MIT数学系和EECS的学生获得本科学位,需要学习的课程问题集、期中考试和期末考试。

包括:

6-1:电气科学与工程;
6-2:电气工程与计算机科学;
6-3:计算机科学与工程;
6-4:人工智能与决策;
18-1:普通数学;
18-2:应用数学;
18-3:纯数学;
18-C:数学与计算机科学。

每个专业的详细分类总结

题目统统出自MIT的数据集,从中随机生成228个问题,不涉及图像和已有解决方案的问题

题目的难度等级由易到难依次为:练习、习题、 期中考试、期末考试、实验和专题。

按答案类型排序,题目的难度由易到难依次为:编程、开放、选择题、数值、表达式和图像。

这一次,参与考试的不只有GPT-4和GPT-3.5,还有StableVicuna-13B、LLaMA-30B和LLaMA-60B

选择让这4个大模型作为考试参赛选手,原因是它们是“最先进的大语言模型”。

最终考试成绩

通过表格里的数据可以看到,得分最高的是经过调优后的GPT-4,得分率100%;表现最一般的是LLaMA-30B,只拿下了30%的分数。

值得关注的是,原始版本的GPT-4开箱即用,完全不经过调优,在本次MIT考试中也拿到了90%的分数

调优流程,包括Few-Shot+CoT+Self-critique+Experts。

从最终考试成绩的表格数据可以看到,从左到右每增加一个环节,调优后的GPT-4得分都会更上一层楼。

此外,研究团队还在提示框里进行了工程优化,具体的“咒语”如下:

等等,评分人是GPT-4自己?

看到这样的结果,不少网友心生感慨,LLM在数学考试上的进步,未免有些神速了哈。

2年前,AI还在苦苦挣扎小学数学问题。

类似“小明种了5柠檬树,每年从每棵树上得到6个柠檬,10年间他总共得到多少柠檬”这种。

去年年初,MIT+哈佛+哥伦比亚大学+滑铁卢大学的联合研究表示,把数学问题转换成等价的编程问题,就可以让GPT-3的同门师兄弟——OpenAI的Codex掌握高数,达到MIT本科水平

学了6门MIT本科基础数学课里随机抽取的例题,6门课程每门随机出25道题,再加上一个ACT水平(美国高考)的数据集里的60道题。

总计210道题,AI全部答对。

不过有人提出,AI达到的“MIT本科水平”,实际是Codex在做语言题而非数学题——

因为当时的评测中,Codex负责读写,并不包括求解。

所以,这一回GPT-4表现奇佳,怎一个妙字了得~

好了,知道你很着急夸它,但你先别着急夸它,因为很快有人发现了一些“诡异”。

主要有2大槽点

第一个值得质疑一番的,就是OpenAI的训练数据集没有完全公布。

这也就意味着,无法证明数据集中的4550个问题和解决方案,在GPT-4的训练集中不存在

换句话说,如果GPT-4在预训练阶段已经接触到了这次的考题们,那最终拿下完美得分,就没什么好惊喜的了。

也难怪乎有网友毫不客气地yygq,认定GPT-4拿到这样的结果,一定是数据集已经包含在训练数据里了。

第二个槽点,就是GPT-4最后100%的得分率,似乎哪里不对劲???

定睛一看,在论文的第2.6节有一句很关键的点:

团队在数据集上微调开源大模型,“给定问题Q、基本事实解S和LLM答案A,我们使用GPT-4自动对模型响应进行评分”。

实际操作上,就是每个大模型生成这次考试的答案,然后派出GPT-4打分,分值在0-5之间。

所以给GPT-4打出满分的,实际上是GPT-4自己。

啊这……很难说没有王婆卖瓜自卖自夸的嫌疑。

此外,关于要给GPT-4提供“好的提示”,才能让它达到满分成绩,也让许多人抱有微词。

到底什么算“好的提示”呢?似乎无法定义。

甚至有人喊着,应该把这些题丢给MIT数学和EECS的学生去做,并不断给他们“好的提示”,这样人类学生也能拿下100%的吧……

One More Thing

一个小小的彩蛋:

整个测试中,基本上可以在笔记本电脑上部署运行的StableVicuna-13B,也有48%的得分率。

这个成绩,不仅比模型更大的LLaMA-65B高出近10个百分点,就连MIT fine-tuing过后的LLaMA-30B,还要高。

让人不得不陷入一些关于模型规模与能力相关性的思考

参考链接:
[1]
https://arxiv.org/abs/2306.08997
[2]https://twitter.com/johnjnay/status/1669687958960586753
[3]https://twitter.com/arankomatsuzaki/status/1669528841629601792
[4]https://twitter.com/emollick/status/1669742473097228292

— 联系作者 —

「AIGC+垂直领域社群」

招募中!

欢迎关注AIGC的伙伴们加入AIGC+垂直领域社群,一起学习、探索、创新AIGC!

请备注您想加入的垂直领域「教育」或「电商零售」,加入AIGC人才社群请备注「人才」&「姓名-公司-职位」。


点这里👇关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
已售出100+份!这套CFA密卷不做完千万不要去考试!【5月CFA考生】这套卷子没做完,千万不要去考试!李彦宏:十年以后,全世界有50%的工作,会是所谓的提示词工程丨看见2033预言家日报刷完这套小学数学图解练习,搞定考试压轴题,冲刺数学满分不再难OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力重磅!OpenAI 开放 GPT-3.5 Turbo 微调,网友:要提示词减少8倍才实惠SAT数学考试满分,高分华裔生被6所名校拒收 勇敢发声2023年卫生资格分数线公布,降分政策出线可低于60分通过!!探索 prompt 编码范式:如何优雅构建测试代码生成提示词?傻x们,求你们放过ChatGPT支持个人定制!告别大段提示词,只需先和它做好自我介绍我的Reiki healing经历,可以说是神奇。【教育】加拿大留学语言考试改革:雅思不看「小分」!新增四个考试!5小时掌握提示词工程,写出高价值大模型Prompt!中文!免费!ChatGPT提示词方法实战:探索一个系统架构设计的案例GPT-4满分通过MIT本科数学考试!这套提示词火了|GGView数学及计算机相关专业“顶流”入学考试如何高效备考?倒计时6天!这套CFA密卷不做完千万不要去考试!ChatGPT离不开提示词!咀外文嚼汉字(230)画眉鸟、画眉人拒绝花架子!盘点ChatGPT最强的七个插件:写提示词、学外语、总结视频,让ChatGPT做你的私人秘书GPT4通过注册会计师考试/孙燕姿首谈「AI孙燕姿」/微软为Win 11添加ChatGPT插件写在孩子满分通过博士答辩数字化智慧病理科建设白皮书:病理科数字化、智慧化转型进行时四月,伦敦马拉松熟悉剧情!英国本土GCSE数学考试最后一题又“难”上热搜了!!为什么华盛顿州的汽油价格全美最高?西雅图市政府希望通过MLB全明星赛挣钱,游客关心的却是安全问题爆火的「GPT-4 MIT本科数学满分」论文作弊,数据集本身有问题看电视连续剧《无间》英国私校11+入学考试考什么?中国低龄留学生最害怕的竟然是这部分考试……“娃英语好数学棒,申请英国女校,却深切感受到了11+入学考试的难……”语言考试怎么选?雅思、托福、PTE、多邻国、朗思,留学考哪个?如何调教AI给你打工?提示词(Prompt)的秘密【Chinatown高级公寓】波士顿地标建筑 | 免中介费 | 免两个月房租 | 高层建筑 | 24小时礼宾服务 | 满分通勤GPT-4考过MIT造假,三位教授联名「甩锅」!猪队友作弊,抢发论文
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。