Redian新闻
>
这是GPT-4变笨的新解释

这是GPT-4变笨的新解释

公众号新闻

机器之心报道

编辑:蛋酱

变笨的本质是知识没进脑子。

自发布以来,曾被认为是世界上最强大的 GPT-4 也经历了多场「信任危机」。


如果说今年早些时候那次「间歇式降智」与 OpenAI 重新设计 GPT-4 架构有关,前段时间的「变懒」传闻就更搞笑了,有人测出只要告诉 GPT-4「现在是寒假」,它就会变得懒懒散散,仿佛进入了一种冬眠状态。


大模型变懒、变笨,具体是指模型在新任务上的零样本性能变差。尽管上述原因听起来很有趣,但问题到底怎么解决呢?


在最近的一篇论文中,加州大学圣克鲁斯分校研究者的新发现或可解释 GPT-4 性能下降的深层原因:


「我们发现,在训练数据创建日期之前发布的数据集上,LLM 的表现出奇地好于之后发布的数据集。」


它们在「见过的」任务上表现出色,而在新任务上则表现糟糕。这意味着,LLM 只是基于近似检索的模仿智能方法,主要是记忆东西,而没有任何程度的理解。


说白了,就是 LLM 的泛化能力「没有说的那么强」—— 基础不扎实,实战总有出纰漏的时候。


造成这种结果的一大原因是「任务污染」,这是数据污染的其中一种形式。我们以前熟知的数据污染是测试数据污染,即在预训练数据中包含测试数据示例和标签。而「任务污染」是在预训练数据中加入任务训练示例,使零样本或少样本方法中的评估不再真实有效。


研究者在论文中首次对数据污染问题进行了系统分析:


论文链接:https://arxiv.org/pdf/2312.16337.pdf


看完论文,有人「悲观」地表示:

这是所有不具备持续学习能力的机器学习(ML)模型的命运,即 ML 模型权重在训练后会被冻结,但输入分布会不断变化,如果模型不能持续适应这种变化,就会慢慢退化。


这意味着,随着编程语言的不断更新,基于 LLM 的编码工具也会退化。这就是为什么你不必过分依赖这种脆弱工具的原因之一。

不断重新训练这些模型的成本很高,迟早有人会放弃这些低效的方法。


目前还没有任何 ML 模型能够可靠地持续适应不断变化的输入分布,而不会对之前的编码任务造成严重干扰或性能损失。


而这正是生物神经网络所擅长的领域之一。由于生物神经网具有强大的泛化能力,学习不同的任务可以进一步提高系统的性能,因为从一项任务中获得的知识有助于改善整个学习过程本身,这就是所谓的「元学习」。

「任务污染」的问题有多严重?我们一起来看下论文内容。


模型和数据集

实验所使用的模型有 12 个(如表 1 所示),其中 5 个是专有的 GPT-3 系列模型,7 个是可免费获取权重的开放模型。



数据集分为两类:2021 年 1 月 1 日之前或之后发布的数据集,研究者使用这种划分方法来分析旧数据集与新数据集之间的零样本或少样本性能差异,并对所有 LLM 采用相同的划分方法。表 1 列出了每个模型训练数据的创建时间,表 2 列出了每个数据集的发布日期。



上述做法的考虑是,零样本和少样本评估涉及模型对其在训练期间从未见过或仅见过几次的任务进行预测,其关键前提是模型事先没有接触过要完成的特定任务,从而确保对其学习能力进行公平的评估。然而,受污染的模型会给人一种未接触或仅接触过几次的能力的假象,因为它们在预训练期间已经接受过任务示例的训练。在按时间顺序排列的数据集中,检测这种不一致性会相对容易一些,因为任何重叠或异常都会很明显。


测量方法

研究者采用了四种方法来测量「任务污染」:


  1. 训练数据检查:在训练数据中搜索任务训练示例。

  2. 任务示例提取:从现有模型中提取任务示例。只有经过指令调优的模型才能进行提取,这种分析也可用于训练数据或测试数据的提取。注意,为了检测任务污染,提取的任务示例不必与现有的训练数据示例完全匹配。任何演示任务的示例都表明零样本学习和少样本学习可能存在污染。

  3. 成员推理:此方法仅适用于生成任务。检查输入实例的模型生成内容是否与原始数据集完全相同。如果完全匹配,就可以推断它是 LLM 训练数据中的一员。这与任务示例提取不同,因为生成的输出会被检查是否完全匹配。开放式生成任务的精确匹配强烈表明模型在训练过程中见过这些示例,除非模型「通灵」,知道数据中使用的确切措辞。(注意,这只能用于生成任务。)

  4. 时序分析:对于在已知时间范围内收集训练数据的模型集,在已知发布日期的数据集上测量其性能,并使用时序证据检查污染证据。


前三种方法精度高,但召回率低。如果能在任务的训练数据中找到数据,那么就能确定模型曾见过示例。但由于数据格式的变化、用于定义任务的关键字的变化以及数据集的大小,使用前三种方法找不到污染证据并不能证明没有污染。


第四种方法,按时间顺序分析的召回率高,但精确度低。如果由于任务污染而导致性能较高,那么按时间顺序分析就有很大机会发现它。但随着时间的推移,其他因素也可能导致性能提高,因此精确度较低。


因此,研究者采用了所有四种方法来检测任务污染,发现了在某些模型和数据集组合中存在任务污染的有力证据。


他们首先对所有测试过的模型和数据集进行时序分析,因为它最有可能发现可能的污染;然后使用训练数据检查和任务示例提取寻找任务污染的进一步证据;接下来观察了 LLM 在无污染任务中的性能,最后使用成员推理攻击进行额外分析。


重点结论如下:


1、研究者对每个模型在其训练数据在互联网上抓取之前创建的数据集和之后创建的数据集进行了分析。结果发现,对于在收集 LLM 训练数据之前创建的数据集,其性能高于大多数基线的几率明显更高(图 1)。



2、研究者进行了训练数据检查和任务示例提取,以查找可能存在的任务污染。结果发现,对于不可能存在任务污染的分类任务,在一系列任务中,模型很少比简单多数基线有统计意义上的显著提高,无论是零样本还是少样本(图 2)。



研究者也检查了 GPT-3 系列和开放 LLM 的平均表现随时间的变化,如图 3:


3、作为案例研究,研究者还尝试对分析中的所有模型进行语义解析任务的成员推理攻击,发现在最终任务中,提取实例的数量与模型的准确性之间存在很强的相关性(R=.88)(图 6)。这有力地证明了在这一任务中零样本性能的提高是由于任务污染造成的。


4、研究者还还仔细研究了 GPT-3 系列模型,发现可以从 GPT-3 模型中提取训练示例,而且从 davinci 到 GPT-3.5-turbo 的每个版本中,可提取的训练示例数量都在增加,这与 GPT-3 模型在该任务上零样本性能的提高密切相关(图 2)。这有力地证明了从 davinci 到 GPT-3.5-turbo 的 GPT-3 模型在这些任务上的性能提高是由于任务污染造成的。


更多研究细节,可参考原论文。




© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
每5个中国人就有3个感染这种病菌!不仅致癌还可能伤脑;GPT-4变笨的原因,有了新解释|本周论文推荐GPT-5明年降临?爆料人泄露多模态Gobi就是GPT-5,已初现自我意识几口就能让娃变笨,甚至影响生育!这些藏在食物中的“隐形酒”,家家都有!鹰角开设新品牌GRYPHLINE:新加坡躺赢,上海F4变新加坡F3“GPT-4变傻”不只是OpenAI的苦恼,所有大模型与人类交往越久就会越蠢?GPT-4 Turbo更强更便宜,GPTs、GPT商店最大亮点,这是OpenAI首个开发者日每周硅闻 | 突发!NVIDIA专攻芯片设计;GPT-4变傻瓜实锤;亚马逊急了!GPT-4变笨!回答新问题性能太差,想保持水准只能不断训练新模型Lululemon创始人一语惊天“我们不是Gap,不适合所有人”!公司急了上海街头皇帝被赶,天冷的一道好菜(图)【数据】1.数据分析与数据解释:揭示并解释趋势百度宣布终止收购 YY;比亚迪 2023 年销量破 300 万;ChatGPT 变笨了?学界给出新解释 | 极客早知道重磅!ChatGPT放大招!GPT Store应用商店今天上线!超300万GPTs,内卷之下的赚钱机会!王者GPT-4已来,32k上下文!OpenAI首届开发者大会最新爆料,全新UI可定制GPT,xAI大模型大范围可用「GPT-4只是在压缩数据」,马毅团队造出白盒Transformer,可解释的大模型要来了吗?让人变笨的7种伤脑食物,最后一种几乎天天吃字节“开盒”OpenAI所有大模型,揭秘GPT-3到GPT-4进化路径!把李沐都炸出来了工信部发《人形机器人创新发展指导意见》;微软撤回ChatGPT参数200亿论文;GPT-4图灵测试成功率41%丨AIGC大事日报微软Copilot进化完全体,代码解释器、DALL·E 3,ChatGPT有的它都有突然跳水!创业板指跌破2000点,发生了什么?传媒板块持续狂飙,券商盛赞:是GPTs竞争的最关键点!这几种食物多吃,孩子真会变傻变笨!一位看到上海万圣节的中年阿姨说:好想哭,又看到人了。新旧文明社会制度的生死搏斗谷歌DeepMind核心大佬被曝离职创业,瞄准AI智能体!曾是Gemini关键负责人这是 GPT-4 变笨的新解释AI早知道|ChatGPT灰度测试多GPTs协同;新Bard逆袭GPT-4;百川智能发布Baichuan3ChatGPT变笨新解释:世界被AI改变,与训练时不同了现场直击OpenAI开发者大会:GPT-4 Turbo、用户自定义GPT、GPT商店,一切都是硅谷新王的架势职场中,你是否有过“变笨”的感觉?“得知姐夫是gay 、男友出轨”:知识以一种极其卑鄙的方式进入了我的脑子......带银手镯会变笨?来听听儿科医生怎么说→我不会原谅把别人的痛苦当做笑谈的人ShareGPT平替!利用苏格拉底提问模拟器更好地蒸馏ChatGPT对话能力以色列和哈马斯的地道战为什么可怕?OpenAI大佬甩出「喵喵GPT」调戏黑客!分享ChatGPT成功的秘密:极限压榨GPU资源
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。