Redian新闻
>
阿里云发布通义千问 2.0,性能超 GPT-3.5,加速追赶 GPT-4 | 新闻

阿里云发布通义千问 2.0,性能超 GPT-3.5,加速追赶 GPT-4 | 新闻

公众号新闻
 
导读:10 月 31 日,阿里云正式发布千亿级参数大模型通义千问 2.0。在 10 个权威测评中,通义千问 2.0 综合性能超过 GPT-3.5,正在加速追赶 GPT-4。当天,通义千问 APP 在各大手机应用市场正式上线,所有人都可通过 APP 直接体验最新模型能力。
本文字数:1426,阅读时长大约:2分钟

作者:阿里云

10 月 31 日,阿里云正式发布千亿级参数大模型通义千问 2.0。在 10 个权威测评中,通义千问 2.0 综合性能超过 GPT-3.5,正在加速追赶 GPT-4。当天,通义千问 APP 在各大手机应用市场正式上线,所有人都可通过 APP 直接体验最新模型能力。

过去 6 个月,通义千问 2.0 在性能上取得巨大飞跃,相比今年 4 月发布的 1.0 版本,通义千问 2.0 在复杂指令理解、文学创作、通用数学、知识记忆、幻觉抵御等能力上均有显著提升。目前,通义千问的综合性能已经超过 GPT-3.5,加速追赶 GPT-4。

图:通义千问2.0综合性能超过 GPT-3.5,正在加速追赶 GPT-4

在 MMLU、C-Eval、GSM8K、HumanEval、MATH 等 10 个主流 Benchmark 测评集上,通义千问 2.0 的得分整体超越 Meta 的 Llama-2-70B,相比 OpenAI 的 Chat-3.5 是九胜一负,相比 GPT-4 则是四胜六负,与 GPT-4 的差距进一步缩小。

中英文理解能力是大语言模型的基本功。英语任务方面,通义千问 2.0 在 MMLU 基准的得分是 82.5,仅次于 GPT-4,通过大幅增加参数量,通义千问 2.0 能更好地理解和处理复杂的语言结构和概念;中文任务方面,通义千问 2.0 以明显优势在 C-Eval 基准获得最高得分,这是由于模型在训练中学习了更多中文语料,进一步强化了中文理解和表达能力。

在数学推理、代码理解等领域,通义千问 2.0 进步明显。在推理基准测试 GSM8K 中,通义千问排名第二,展示了强大的计算和逻辑推理能力;在 HumanEval 测试中,通义千问得分紧跟 GPT-4 和 GPT-3.5,该测试主要衡量大模型理解和执行代码片段的能力,这一能力是大模型应用于编程辅助、自动代码修复等场景的基础。

图:通义千问 2.0 发布

通义千问更成熟了,也更好用了。通义千问 2.0 在指令遵循、工具使用、精细化创作等方面作了技术优化,能够更好地被下游应用场景集成。通义大模型官网上线了多模态和插件功能,支持图片输入、文档解析等细分任务。

与此同时,基于通义大模型训练的 8 大行业模型组团上线,它们分别是:

◈ 通义灵码:智能编码助手
◈ 通义智文:AI 阅读助手
◈ 通义听悟:工作学习 AI 助手
◈ 通义星尘:个性化角色创作平台
◈ 通义点金:智能投研助手
◈ 通义晓蜜:智能客服
◈ 通义仁心:个人专属健康助手
◈ 通义法睿:AI 法律顾问。

8 大行业模型面向当下最受欢迎的多个垂直场景,使用领域数据进行专门训练。用户可以在官网直接体验模型功能,开发者可以通过网页嵌入、API/SDK 调用等方式,将模型能力集成到自己的大模型应用和服务中。

图:通义大模型家族全面升级,8 大行业模型组团上线

截至 10 月,阿里云已与 60 多个行业头部伙伴进行深度合作,推动通义千问在办公、文旅、电力、政务、医保、交通、制造、金融、软件开发等领域的落地。 

周靖人透露,阿里云计划近期开源通义千问 72B 版本,此前,阿里云已先后开源 7B 和 14B 版本模型,模型累计下载量超过 100 万。阿里云将持续支持千行百业的开发者基于通义千问开源模型进行模型和应用创新。


微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
LangChain+通义千问+AnalyticDB向量引擎保姆级教程时间的湾 1OpenAI 忙着“宫斗”,手握 2.2 万块 H100 的竞争对手趁机发布新款大模型:1750 亿参数,性能仅次于 GPT-4通义千问2.0来了!实测编程打败8成Python用户,阿里云大模型「全家桶」炸场OpenAI忙着“宫斗”,手握2.2万块H100的竞争对手趁机发布新款大模型:1750亿参数,性能仅次于GPT-4武汉AI方案出台六大计划;360讯飞WPS大模型面向全民开放;阿里云发布开源LLM开发框架AMD最强生成式AI核弹发布!跑大模型性能超H100,预告下一代AI PC处理器丢弃99%的参数!阿里团队提出语言模型合体术,性能暴涨且无需重新训练和GPU【孝子贤孙伺候着】之(5)兵不厌诈上手通义千问2.0后,我才发现大模型的天敌是伍佰。通义千问登顶 Hugging Face 榜首,国产开源大模型赶超 Llama2参数量仅为1/700,性能超越GPT-3.5!CMU+清华开源Prompt2Model框架ChatGPT测试上传文件功能;百川推出192K长文本大模型;通义千问App安卓版上线丨AIGC大事日报阿里云突发严重故障,淘宝、闲鱼、阿里云盘、钉钉“崩”上热搜!历经 2.5 小时恢复全新双发矢量发动机亮相,成飞专利方案,性能超F35B智能周报|OpenAI发布ChatGPT企业版,预计今年营收10亿美元;首批11家国产大模型「获批」,不包括阿里巴巴通义大模型阿里云 CTO 周靖人:AI 时代,为什么阿里云一定要做开源阿里云通义千问向全社会开放;OpenAI被作家起诉侵犯版权;工信部启动AGI等4大未来产业揭榜挂帅|AIGC周观察第十九期阿里云通义千问全面开放|首席资讯日报通义千问爆甩开源全家桶!最强720亿参数超车Llama 2,新上视觉模型看图直出代码《歌德堡变奏曲1359》chat gpt 怎么上不去了? 彻底罢工了阿里云通义千问140亿参数Qwen-14B发布;TCL中环签约首个绿电园区项目|绿研院日报5分钟搞出大模型应用!阿里云通义“全家桶”来了,从基础设施到应用平台全栈技术UPLEARN FRENCH IN 5 DAYS # DAY 1未央播报 | 25日起存量首套房贷利率批量下调 阿里云宣布开源通义千问14B模型MLPerf放榜,中国AI芯片公司再获世界第一!大模型推理三项冠军,性能超越H100小米14/14Pro首发评测:影像对标 Ultra,性能追赶 iPhoneiPhone 16或全系告别静音拨片/微信称好友上限约1万个/阿里云开源通义千问720亿参数模型| 灵感周报英伟达发布最强AI芯片H200,性能狂飙/苹果将叫停摇一摇跳转广告/GPT-5 正在开发中GPT turbo 看了没?!这真是大批失业人员在路上。苹果大模型核心团队首次曝光!每天砸数百万美元研发,传性能超GPT-3.5Google语言模型反击战!部分性能超越ChatGPT!720亿参数大模型都拿来开源了!通义千问开源全家桶,最小18亿模型端侧都能跑大模型访问链接汇总:通义千问开放!阿里将继续对阿里云进行分拆上市,传阿里云考虑从国有公司融资至多28亿美元【齐风猎作品】之子于归【五律】无题
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。