Redian新闻
>
用视觉来做Prompt!沈向洋展示IDEA研究院新模型,无需训练或微调,开箱即用

用视觉来做Prompt!沈向洋展示IDEA研究院新模型,无需训练或微调,开箱即用

公众号新闻
白交 发自 凹非寺
量子位 | 公众号 QbitAI

用视觉来做Prompt,是种什么体验?

只需在图里随便框一下,结果秒秒钟圈出同一类别!

即便是那种GPT-4V都难搞定的数米粒的环节。只需要你手动拉一下框,就能找出所有米粒来。

新的目标检测范式,有了!

刚刚结束的IDEA年度大会上,IDEA研究院创院理事长、美国国家工程院外籍院士沈向洋展示了最新研究成果——

基于视觉提示(Visual Prompt)模型T-Rex。

整个流程交互,开箱即用,只需几步就可以完成。

此前,Meta开源的SAM分割一切模型,直接让CV领域迎来了GPT-3时刻,但仍是基于文本prompt的范式,在应对一些复杂、罕见场景就会比较难办。

现在以图换图的方式,就能轻松迎刃而解。

除此之外,整场大会也是干货满满,比如Think-on-Graph知识驱动大模型、开发者平台MoonBit月兔、AI科研神器ReadPaper更新2.0、SPU机密计算协处理器、可控人像视频生成平台HiveNet等等。

最后,沈向洋还分享了过去几年时间花时间最多的一个项目:低空经济

我相信当低空经济发展到相对成熟时,同一个时间点,在深圳的天空中每天有10万架无人机,每天飞起来的有百万架无人机。

用视觉来做Prompt

除了基础的单轮提示功能,T-Rex还支持三种进阶模式。

  • 多轮正例模式

有点像多轮对话,以得出更为精确的结果,不至于出现漏检的情况。

  • 正例+负例模式

适用于视觉提示带有二义性造成误检的场景。

* 跨图模式。

用单张参考图提示,来检测其他的图。

据介绍,T-Rex不会受到预定义类别限制,能够利用视觉示例指定检测目标,这样一来就克服有些物体难以用文字充分表达的问题,以提高提示效率。尤其像一些工业场景中的复杂组件等。

除此之外,通过与用户交互的方式,也可以随时快速地评估检测结果,并进行纠错等。

T-Rex主要由三个组件组成:图像编码器、提示编码器以及框解码器。

这项工作来自IDEA研究院计算机视觉与机器人研究中心。

该团队此前开源的目标检测模型DINO是首个在COCO目标检测上取得榜单第一的DETR类模型;在Github上大火(至今狂揽11K星)的零样本检测器Grounding DINO与能够检测、分割一切的Grounded SAM。更多技术细节可戳文末链接。

整场大会干货满满

除此之外,IDEA大会上还重点分享了几个研究成果。

比如Think-on-Graph知识驱动大模型,简单来说就是将大模型与知识图谱结合。

大模型擅长意图理解和自主学习,而知识图谱因其结构化的知识存储方式,更擅长逻辑链条推理。

Think-on-Graph通过驱动大模型agent在知识图谱上“思考”,逐步搜索推理出最优答案(在知识图谱的关联实体上一步一步搜索推理)。每一步推理中,大模型都亲自参与,与知识图谱相互取长补短。

MoonBit月兔,这是由Wasm驱动,专为云计算与边缘计算设计的开发者平台。

它不仅提供通用程序语言设计,还整合了编译器、构建系统、集成开发环境(IDE)、部署工具等版块,来提升开发体验与效率。

此前发布的科研神器ReadPaper也更新至2.0,发布会现场演示了阅读copilot、润色copilot等新功能。

发布会最后,沈向洋发布《低空经济发展白皮书——深圳方案》,在其智能融合低空系统(Smart Integrated Lower Airspace System,SILAS)中,提出时空进程(Temporal Spatial Process)新概念。

T-Rex链接:
https://trex-counting.github.io/

MEET 2024大会定档!

最新嘉宾阵容公布

12月14日,量子位「MEET2024智能未来大会」不容错过点击报名线下参会

李培根院士、李开复博士及十余位AI各领域领先企业核心负责人已确认出席!戳此了解嘉宾详情:第二批嘉宾来袭!报名MEET2024的理由,今天又多了一个

点击“预约”按钮,一键直达大会直播现场!


点这里👇关注我,记得标星噢

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
Diving Controversy Prompts Sports Fandom Criticism比Siri更懂iPhone!GPT-4V可“操作”手机完成任意指令,无需训练6015 血壮山河之随枣会战 南昌之战 8从错误中学习!腾讯AI Lab提出诱导大模型自身幻觉来消除幻觉戏说旧诗词。 歪侃豪放派汽车之家研究院&新榜研究院:2023汽车厂商新媒体营销趋势洞察报告无需训练实现价值观实时动态对齐:上交开源价值观对齐方法OPO,闭源与开源大模型均适用利用视觉大模型,虹软引发商拍市场一场豹变|甲子光年7B羊驼战胜540B“谷歌版GPT”,MIT用博弈论调教大模型,无需训练就能完成大模型自我奖励:Meta让Llama2自己给自己微调,性能超越了GPT-4免训练!单图秒级别生成AI写真,人像生成进入无需训练的单阶段时代懂语言者得天下,IDEA 研究院沈向洋宣布重磅研产结晶[电脑] 华硕首款 420 一体式水冷,ProArt 系列新成员,ProArt LC 420 开箱分享工业异常检测大模型来了!哈工大提出Myriad:利用视觉专家进行工业异常检测的大型多模态模型Spring Boot 3.2 正式发布,开箱即用的虚拟线程和 GraalVM,尝鲜一下!北大具身智能新成果:无需训练,听指令就能灵活走位马毅、沈向洋联手,首届CPAL开奖!16人获新星奖,华人学者占据半壁江山猎户星空推出微调大模型,多项测评霸榜,开源免费!AMD王宏强:700亿参数大模型单个GPU部署,做好AI软件和生态实现“开箱即用”丨GACS 2023ChatGPT代码生成飙升10%!北大华人一作:细化prompt,大幅改进大模型代码能力LVM 是噱头还是通用视觉的新突破?香港科技大学校董会主席、美国国家工程院外籍院士沈向洋:未来世界将由人工智能体和人类共同打造免税还享7折!手持银联卡或微信支付,一定要薅樟宜购物节这个大羊毛[掌设] 很久不开箱,X100Pro 星际蓝 开箱简评0.2美元微调就能让ChatGPT彻底破防!普林斯顿、斯坦福发布LLM风险预警:普通用户微调也影响LLM安全性微软仅凭「提示工程」让GPT-4成医学专家!超过一众高度微调模型,专业测试准确率首次超90%直播预告 | 阿里巴巴NLP算法专家王潇斌:开箱即用的文本理解大模型快消外企社招 | Lagardère拉格代尔,世界三大旅行零售商之一,百年外企,平均月薪17.2k,0经验可投,留学生有优势自动生成prompt:Automatic prompt engineering三十六计里面我最想中的计就是第三十一计!提供开箱即用的一站式数据库云平台,「 沃趣科技」完成数千万B+轮战略融资|​36氪首发通用视觉推理显现,UC伯克利炼出单一纯CV大模型,三位资深学者参与NeurIPS 2023 | InstructBLIP:指令微调训练通用视觉-语言模型飞机拔河無聊的假日里
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。