Redian新闻
>
斯坦福20亿参数端测多模态AI Agent模型大升级,手机汽车机器人都能用

斯坦福20亿参数端测多模态AI Agent模型大升级,手机汽车机器人都能用

公众号新闻
允中 发自 凹非寺
量子位 | 公众号 QbitAI

全球首个超小型多模态AI Agent模型Octopus V3,来自斯坦福大学的NEXA AI团队,让Agent更加智能、快速、能耗及成本降低。

今年四月份初,NEXA AI推出了备受瞩目的Octopus V2,该模型在函数调用性能上超越了GPT-4,减少了95%的推理时所需的文本量,为端侧AI应用带来了新的可能性。其专利性核心技术“functional token”通过创新的函数调用方式显著减少推理时所需的文本长度。

这种方法使得模型能够在只有20亿参数的情况下实现高效训练,并在精度和延迟方面超越了GPT-4,适应了各种端设备的部署需求。

发布以来,Octopus V2在LLM社区获得了广泛关注,受到了AI领域大量前沿技术专家及研究者的赞赏,如Hugging Face的CTO Julien Chaumond、知名AI Newsletter Rundown AI的创始人 Rowan Cheung以及Figure AI的创始人Brett Adcock、OPPO边缘人工智能团队负责人Manoj Kumar,称其“开创了端侧AI技术新纪元”。

在知名开源AI平台Hugging Face上,Octopus V2下载量已经超过12000次。

在不到一个月的时间里,NEXA AI团队发布下一代多模态AI Agent模型Octopus V3,展现进一步突破:具有图像处理和多语言文本处理能力,为智能手机等端侧设备真正走向AI时代铺平了道路。

首个参数量小于10亿的多模态AI Agent模型

Octopus V3不仅拥有多模态能力,在函数调用性能上远超同类模型,可媲美GPT-4V+GPT4;而且模型参数量不到10亿,具有多语言能力。

也就是说,相比传统的大型语言模型,它体积更小,能耗更低,能够更加轻松地在各种小型端设备上运行,比如树莓派,并做到高速且准确的函数调用。

这意味着,未来AI Agent能够广泛应用于智能手机、AR/VR、机器人、智能汽车等端侧设备,为用户交互体验更加流畅、智能。

另一方面,由于V3具有多模态处理能力,可同时处理文本和图像输入,再加上多语言能力,也将让用户体验更加丰富。

例如,在Instacart购物应用中,用户可以通过一张菠萝的图片及简单的对话指令,让AI Agent自动为他们搜索商品,提高了效率和用户的体验。

再比如,在发送邮件等场景中,Octopus V3可以根据一张具有文字的图像,自动提取信息并填写邮件内容,为用户提供更加智能、便捷的服务。


从软件交互到智能汽车,端侧AI潜力巨大

基于这些特性,Octopus V2及V3的应用场景丰富多样,具有广泛的应用前景。

除上文提到的手机场景,当Octopus V2应用在智能汽车上时,也能带来新的交互体验。目前的语音助手往往难以帮助车主完成较为复杂的任务,如在驾驶途中临时改变目的地、加入额外停靠点等。应用Octopus V3后,AI助手能够基于较为模糊简单的指令快速、精准地完成相应任务。

结合V2、V3的能力,从信息检索、到基于指令完成设计,用户可以在虚拟场景下获得流畅的AI体验:在一个社区用户的VR场景demo中,输入简单的语音指令后,AI Agent能够帮助用户快速完成一个客厅设计,在弹指间替换沙发、改变颜色灯光等。在用户输入旅行指令后,用户快速来到了日本,而AI Agent同样可以在简单的对话式交流中帮助用户搜索相应景点,提供丰富的信息。

数据显示,全球大型语言模型市场规模正在快速增长。Granview Research报告显示,全球大型语言模型市场规模估计为43.5亿美元,并预计从2024年到2030年的复合年增长率为35.9%。同样,边缘人工智能市场也呈现出蓬勃发展的势头——预计从2023年到2030年,全球边缘人工智能市场的复合年增长率为21.0%,到2030年将达到664.78亿美元。

NEXA AI团队由斯坦福大学的杰出研究人员创立。

创始人兼首席科学家Alex Chen(陈伟)正在攻读斯坦福大学的博士学位,拥有丰富的人工智能研究经验,并且曾担任斯坦福华人创业协会(Stanford Chinese Entrepreneurs Organization)的主席。

联合创始人兼首席技术官Zack Li(李志远)也是斯坦福大学的毕业生,并在Google和Amazon Lab126实验室拥有4年端侧AI的一线研发经验,同样曾经担任斯坦福华人创业协会的主席。

斯坦福大学副教授、斯坦福技术创业项目副主任Charles (Chuck) Eesley担任顾问,为团队提供指导和支持。

左:李志远;右:陈伟

目前,NEXA AI的独创性技术已申请专利保护。

NEXA AI的创始团队表示,他们将继续致力于推动端侧AI技术的发展,通过开源模型提升其创新技术的影响力,为用户创造更智能、高效的未来生活。

论文地址:
https://arxiv.org/abs/2404.11459

*本文系量子位获授权刊载,观点仅为作者所有。


—  —

量子位 QbitAI

վ'ᴗ' ի 追踪AI技术和产品新动态

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
微软拟与OpenAI投资1000亿美元建AI超算;Databricks 推出1320亿参数大语言模型 DBRX丨AIGC日报5亿参数“小模型”如何超越千亿级参数大模型GPT-3.5?对话联想创投宋春雨:相信万亿参数、多模态是通往 AGI 的最佳路径赋予机器人思考能力!北大提出自纠正多模态大模型,赋能端到端机器人操作外企社招丨Dräger德尔格,行业全球领导者,15薪,六险一金,多样福利,偏爱留学生只要千元级,人人可用百亿级多模态大模型!国产「AI模盒」秒级训练推理支持百亿参数大模型、卢伟冰现场官宣小米首发,高通骁龙8s Gen3发布天际马斯克大模型Grok1.5来了:推理能力大升级,支持128k上下文最强开源大模型 Llama 3震撼发布!开源模型将追上GPT-4,4000亿参数模型也在路上国产黑马一年肝出万亿参数MoE!霸榜多模态,剑指AGIAI早知道|元象开源首个多模态大模型XVERSE-V;信通院发布国内首个汽车大模型标准面壁发布多模态小钢炮仅仅 8B 参数规模,超越 GPT-4V 和 Gemini Pro全球最强开源模型一夜易主,1320亿参数推理飙升2倍!那些花儿AI早知道|腾讯智影宣布声音模型大升级;淘宝推出天猫AI讲价小助手一文看懂斯坦福2024年AI指数报告十大趋势多模态AI是医学的未来,谷歌推出三个新模型,Med-Gemini迎来大升级北京内推 |​ 商汤研究院基础多模态大模型组招聘多模态方向算法实习生GLM-4开源版本终于来了:超越Llama3,多模态比肩GPT4V,MaaS平台也大升级大模型又开“卷”!万亿参数闭源模型、四千亿开源模型来了全球顶尖AI研究者中国贡献26%;1320亿参数大模型开源;Anthropic大模型测评首超GPT-4丨AIGC大事日报AI视觉的“大一统”:从CV到多模态,从行业大模型到机器人,旷视如何布局?美国档案--手写字母T和Y给机器人装上大模型大脑,「若愚科技」获超5000万天使轮融资|36氪首发开源大模型王座再易主,通义千问1100亿参数拿下SOTA,3个月已推出8款模型让大模型理解手机屏幕,苹果多模态Ferret-UI用自然语言操控手机阿里林俊旸:大模型对很多人来说不够用,打造多模态Agent是关键 | 中国AIGC产业峰会性能超越 GPT-4 Turbo!「商汤日日新」大升级,国产大模型超市开张了李未可科技古鉴:发布自研多模态大模型WAKE-AI,三大优化让AI眼镜交互体验升级 丨GenAICon 2024飞机汽车都出事!墨尔本航班起飞,竟忘记关门!14岁少年开比亚迪“大闹”Westfield,横冲直撞,多人受伤32岁浙大医生潘博文猝死!死因为生病后打篮球,家人到球场送别!零一万物发布千亿参数模型 Yi-Large,李开复:中国大模型赶上美国,立志比肩 GPT-5开源大模型王座再易主,1320亿参数DBRX上线,基础、微调模型都有希腊三哲:苏格拉底柏拉图亚里士多德
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。