Redian新闻
>
轻量版ChatGPT训练方法开源!仅用3天围绕LLaMA打造,号称训练速度比OpenAI快15倍

轻量版ChatGPT训练方法开源!仅用3天围绕LLaMA打造,号称训练速度比OpenAI快15倍

公众号新闻
萧箫 发自 凹非寺
量子位 | 公众号 QbitAI

基于Meta模型打造的轻量版ChatGPT,这就来啦?

Meta宣布推出LLaMA才三天,业界就出现了把它打造成ChatGPT的开源训练方法,号称比ChatGPT训练速度最高快15倍

LLaMA是Meta推出的超快超小型GPT-3,参数量只有后者的10%,只需要单张GPU就能运行。

把它变成ChatGPT的方法名叫ChatLLaMA,基于RLHF(基于人类反馈的强化学习)进行训练,在网上很快掀起了一阵热度。

所以,Meta的开源版ChatGPT真的要来了?

先等等,事情倒也没那么简单。

把LLaMA训练成ChatGPT的“开源方法”

点进ChatLLaMA项目主页来看,会发现它实际上集成了四个部分——

DeepSpeed、RLHF方法、LLaMA和基于LangChain agent生成的数据集。

其中,DeepSpeed是一个开源深度学习训练优化库,包含名叫Zero的现存优化技术,用于提升大模型训练能力,具体指帮模型提升训练速度、降低成本、提升模型可用性等。

RLHF则会采用奖励模型来对预训练模型进行微调。奖励模型即先用多个模型生成问题问答,再依靠人工对问答进行排序,让它学会打分;随后,基于奖励学习给模型生成的回答进行打分,通过强化学习的方式增强模型能力。

LangChain是一个大语言模型应用开发库,希望将各种大语言模型整合起来,结合其他知识来源或计算能力创建一个实用的应用程序。LangChain agent则会像思维链一样放出GPT-3思考的全过程,将操作记录下来。

这时候你会发现,最关键的依旧是LLaMA的模型权重。它从哪里来?

嘿嘿,自己去找Meta申请吧,ChatLLaMA并不提供。(虽然Meta声称开源LLaMA,但依旧需要申请)

所以本质上来说,ChatLLaMA并不是一个开源ChatGPT项目,而只是一种基于LLaMA的训练方法,其库内集成的几个项目原本也都是开源的。

实际上,ChatLLaMA也并非由Meta打造,而是来自一个叫做Nebuly AI的初创AI企业。

Nebuly AI做了一个叫做Nebullvm的开源库,里面集成了一系列即插即用的优化模块,用于提升AI系统性能。

例如这是Nebullvm目前包含的一些模块,包括基于DeepMind开源的AlphaTensor算法打造的OpenAlphaTensor、自动感知硬件并对其进行加速的优化模块……

ChatLLaMA也在这一系列模块中,但要注意的是它的开源license也是不可商用的。

所以“国产自研ChatGPT”想要直接拿去用,可能还没那么简单(doge)

看完这个项目后,有网友表示,要是有人真搞到LLaMA的模型权重(代码)就好了……

但也有网友指出,“比ChatGPT训练方法快15倍”这种说法是一个纯纯的误导:

所谓的快15倍只是因为LLaMA模型本身很小,甚至能在单个GPU上运行,但应该不是因为这个项目所做的任何事情吧?

这位网友还推荐了一个比库中效果更好的RLHF训练方法,名叫trlx,训练速度要比通常的RLHF方法快上3~4倍:

你拿到LLaMA的代码了吗?觉得这个训练方法如何?

ChatLLaMA地址:
https://github.com/nebuly-ai/nebullvm/tree/main/apps/accelerate/chatllama

参考链接:
https://twitter.com/omarsar0/status/1630211059876339713

「中国AIGC产业峰会」启动

邀您共襄盛举

「中国AIGC产业峰会」即将在今年3月举办,峰会将邀请AIGC产业相关领域的专家学者,共同探讨生成新世界的过去、现在和未来。

峰会上还将发布《中国AIGC产业全景报告暨AIGC 50》,全面立体描绘我国当前AIGC产业的竞争力图谱。点击链接或下方图片查看大会详情:

寻找中国版ChatGPT,量子位邀你共同参与中国AIGC产业峰会


点这里👇关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 


微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
Meta版ChatGPT惨遭“开源”?最新大模型LLaMA被泄露,已在GitHub收获7k+星女儿突然打来的国际长途电话邱开冒:2022年,两场奇怪的战争LLaMA模型惨遭泄漏,Meta版ChatGPT被迫「开源」!GitHub斩获8k星,评测大量出炉「AMD史上最大芯片」炸场CES:1460亿晶体管,可大幅压缩ChatGPT训练时间开源版ChatGPT来了?多数任务效果超越GPT3,已开源!ChatGPT讲座:ChatGPT并不神秘,但ChatGPT很神奇又一大模型惨遭泄漏,Meta版ChatGPT被迫开源!马斯克等要求暂停GPT训练!我们采访了ChatGPT,它这么看→ChatGPT开源平替来了,开箱即用!前OpenAI团队打造,GitHub刚发布就揽获800+星ChatGPT全新功能公开演示!OpenAI总裁:ChatGPT会重新定义计算机(全文记录)集成ChatGPT后必应日活量首破亿!微软推出Azure OpenAI ChatGPT 服务,GPT-4下周发布谷歌用ChatGPT训练AI,新时代的版权风暴更复杂了!开源版ChatGPT,30分钟训完,性能堪比GPT3.5!微信回应头像褪色,部分C刊不准隐瞒ChatGPT使用,微软推进裁员,Opera新版集成ChatGPT,这就是今天的其它大新闻!号称可以成为 ChatGPT 平替的开源模型 “Dolly” | Linux 中国清华AIR开源轻量版BioMedGPT!聂再清:最终目标是生物医药领域基础大模型2022辞旧迎新谷歌急投20亿押注ChatGPT「最强竞品」,GPT-3核心成员出走打造,多方出击抗衡微软波性与粒性百度版ChatGPT确定为“文心一言”/ 戴尔裁员5%/ 苹果要开会应对ChatGPT…今日更多新鲜事在此地球围绕太阳转,月球围绕地球转,为何没有天体围绕月球转?lāo dao?láo dao!ChatGPT的替代品来了!HuggingChat号称媲美GPT-3.5,要拆掉OpenAI的围墙谷歌用ChatGPT训练AI?新的版权风暴来了!这是Meta版ChatGPT雏形?开源、一块GPU就能跑,1/10参数量打败GPT-3NeurIPS 2022 | 训练速度100倍提升!基于PyTorch实现的可微逻辑门网络开源Meta发布全新大语言模型,号称比ChatGPT更强,单GPU上就能跑,后续或将开源微软开源“傻瓜式”类ChatGPT模型训练工具,提速省钱15倍舅舅走了,天上添一尊如来!视觉版ChatGPT来了!吸收AI画画全技能,MSRA全华人团队打造,微软16年老将领衔训练个中文版ChatGPT没那么难:不用A100,开源Alpaca-LoRA+RTX 4090就能搞定ChatGPT背后大模型如何高效训练?京东探索研究院、悉大、中科大60页论文详述五大类训练方法微软宣布开源DeepSpeed-Chat ,训练提速15倍以上,有望实现人手一个ChatGPT?中文对话大模型BELLE全面开源!(附:数据+模型+轻量化)
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。