Redian新闻
>
仅需10%参数量即超越SOTA!浙大、字节、港中文联合提出「类别级位姿估计」任务新框架|CoRL2022

仅需10%参数量即超越SOTA!浙大、字节、港中文联合提出「类别级位姿估计」任务新框架|CoRL2022

公众号新闻



  新智元报道  

编辑:LRS
【新智元导读】新位姿估计模型:位姿和形状解耦估计,用最少的参数量训练,获得最优的效果。
 

赋予机器人对日常物体的 3D 理解是机器人应用中的一项重大挑战。

 

在未知环境中进行探索时,由于物体形状的多样性,现有的物体位姿估计方法仍然不能令人满意。

 

 

最近浙江大学、字节跳动人工智能实验室和香港中文大学的研究者联合提出了一个新的框架,用于从单个 RGB-D 图像进行类别级物体形状和位姿估计。

 

论文地址:https://arxiv.org/abs/2210.01112

项目链接:https://zju3dv.github.io/gCasp

 

为了处理类别内物体的形状变化,研究人员采用语义原始表示,将不同的形状编码到一个统一的隐空间中,这种表示是在观察到的点云和估计的形状之间建立可靠对应关系的关键。

 

然后通过设计的对刚体相似变换不变的形状描述子,解耦了物体的形状和位姿估计,从而支持任意位姿中目标物体的隐式形状优化。实验表明所提出的方法在公开数据集中实现了领先的位姿估计性能

 

研究背景

 

在机器人的感知与操作领域,估计日常物体的形状和位姿是一项基本功能,并且具有多种应用,其中包括 3D 场景理解、机器人操作和自主仓储。

 

该任务的早期工作大多集中在实例级位姿估计上,这些工作主要通过将观察到的物体与给定的 CAD 模型对齐来获得物体位姿。

 

然而,这样的设置在现实世界的场景中是有限的,因为很难预先获得一个任意给定物体的确切模型。

 

为了推广到那些没见过但是在语义上熟悉的物体,类别级别物体位姿估计正在引起越来越多的研究关注,因为它可以潜在地处理真实场景中同一类别的各种实例。

 

 

现有的类别级位姿估计方法通常尝试预测一个类中实例的像素级归一化坐标,或者采用形变之后的参考先验模型来估计物体位姿。

 

尽管这些工作已经取得了很大的进步,但是当同一类别中存在较大的形状差异时,这些一次性预测方法仍然面临困难。

 

为了处理同一类内物体的多样性,一些工作利用神经隐式表示,通过迭代优化隐式空间中的位姿和形状来适应目标物体的形状,并获得了更好的性能。

 

在类别级物体位姿估计中有两个主要挑战,一是巨大的类内形状差异,二是现有的方法将形状和位姿的耦合在一起进行优化,这样容易导致优化问题更加复杂。

 

在这篇论文中,研究人员通过设计的对刚体相似变换不变的形状描述子,解耦了物体的形状和位姿估计,从而支持任意位姿中目标物体的隐式形状优化。最后再根据估计形状与观测之间的语义关联,求解出物体的尺度与位姿。

 

算法介绍


算法由三个模块组成,语义原语提取生成式形状估计物体位姿估计

 

 

算法的输入是单张 RGB-D 图像,算法使用预先训练好的 Mask R-CNN 获得 RGB 图像的语义分割结果,然后根据相机内参反投影得到每个物体的点云。该方法主要对点云进行处理,最终求得每个物体的尺度与6DoF位姿。

 

语义原语提取


DualSDF[1] 中提出了一种针对同类物体的语义原语的表示方法。如下图左所示,在同一类物体中,每个实例都被分成了一定数量的语义原语,每个原语的标签对应着某类物体的特定部位。

 

为了从观测点云中提取物体的语义原语,作者利用了一个点云分割网络,将观测点云分割成了带有标签的语义原语。

 

 

生成式的形状估计


3D的生成模型(如DeepSDF)大多是在归一化的坐标系下运行的。

 

然而在真实世界观测中的物体与归一化坐标系之间会存在一个相似位姿变换(旋转、平移以及尺度)。

 

为了在位姿未知时来求解当前观测对应的归一化形状,作者基于语义原语表示,提出了一种对相似变换不变的形状描述子。

 

这种描述子如下图所示,它描述了不同原语构成的向量之间的夹角:

 

 

作者通过这个描述子来衡量当前观测与估计形状之间的误差,并通过梯度下降来使得估计形状与观测之间更加一致,过程如下图所示。 


作者另外展示了更多的形状优化示例。


位姿估计


最后,通过观测点云与求解形状之间的语义原语对应关系,作者使用 Umeyama 算法求解了观测形状的位姿。


实验结果


作者在 NOCS 提供的 REAL275(真实数据集) 和 CAMERA25(合成数据集) 数据集上进行了对比实验,与其他方法在位姿估计精度上进行了对比,所提出的方法在多项指标上远超其他方法。

 

同时,作者也对比了需要在 NOCS 提供的训练集上训练的参数量,作者需要最少的2.3M的参数量便达到了最先进水平。

 

参考资料:
[1] Wang, He, et al. "Normalized object coordinate space for category-level 6d object pose and size estimation." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2019. 
[2] Hao, Zekun, et al. "Dualsdf: Semantic shape manipulation using a two-level representation." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2020. 
[3] Park, Jeong Joon, et al. "Deepsdf: Learning continuous signed distance functions for shape representation." Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2019. 
[4] Deng, Xinke, et al. "iCaps: Iterative Category-Level Object Pose and Shape Estimation." IEEE Robotics and Automation Letters 7.2 (2022): 1784-1791. 
[5] Tian, Meng, Marcelo H. Ang, and Gim Hee Lee. "Shape prior deformation for categorical 6d object pose and size estimation." European Conference on Computer Vision. Springer, Cham, 2020. 
[6] Umeyama, Shinji. "Least-squares estimation of transformation parameters between two point patterns." IEEE Transactions on Pattern Analysis & Machine Intelligence 13.04 (1991): 376-380.



微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
Canada's Wonderland冬季嘉年华门票闪购,仅需19.99元!Meta发布首个「非参数化」掩码语言模型NPM:吊打500倍参数量的GPT-3紧急!大摩、字节、安永等1000+岗位秋招补录时间表汇总!无套路直接领!AAAI 2023 | 超越SOTA 3.27%,上交大等提出自适应本地聚合新方法ECCV 2022 ScanRefer Challenge冠军方法!山大&美团联合提出端到端“火腿”网络, 性能首次突破40%!大摩、字节、安永等1000+岗位秋招补录时间表!无套路直接领!长江策略包承超:尝试统一盈利与估值的新框架趣图:尝试新框架NeurlPS 2022 | 全新大模型参数高效微调方法:仅需训练0.3M的参数“碳”路可持续发展 华夏理财与香港中文大学(深圳)联合发布《2022年度中国资管行业ESG投资发展研究报告》The most significant legacy of Queen Elisabeth IICoRL 2022 | 清华&天津大学提出SurroundDepth:自监督环视深度估计网络[摄影] 末日辉煌-佳能EOS 1V+35L2+85L2分享NeurlPS 2022 | 全新大模型参数高效微调方法SSF:仅需训练0.3M的参数,效果卓越「美国三角会计」Steve Niu博士,2022年12月加州之行在夏夜花好月圆,中秋快乐!首次突破30FPS!天大、清华和卡迪夫联合提出基于单RGB相机的全新三维表示方法FOF|NeurIPS 2022伊朗国产天盾大升级!信仰373远程防空导弹射程大增超越S-300训练ViT和MAE减少一半计算量!Sea和北大联合提出高效优化器Adan,深度模型都能用还有1个月,乘用车搭载首超5百万辆!L2/L2+前装交付一路狂奔可扩展、可解释,新框架从预训练语言模型中高效提取知识图谱扩散模型再发力!Hinton团队提出:图像和视频全景分割新框架NeurIPS 2022 | PointTAD: 基于稀疏点表示的多类别时序动作检测框架斩获数亿元B轮融资,这家Tier 1抢跑「L2/L2+」主战场《东圣节-幸福夜》记念毛泽东触摸美国 53 夏威夷之旅「美国三角会计」牵线搭桥,‘美国华人华侨联合总会’与‘长明矿业管理控股集团’战略合作签约破纪录!2022年中国学者在Nature及Science共计发表267篇文章,高校清华、北大、浙大前三Soft Diffusion:谷歌新框架从通用扩散过程中正确调度、学习和采样一块RTX3050搞定DLRM训练!仅需1%Embedding参数,硬件成本降低至十分之一 | 开源【周末去哪玩】10/08-10/09 | 旧金山舰队周、公园南瓜节、住棚节、亲子赛马会、水灯节、儿童图书博览会、水岸烟花大会【圣诞去哪玩】12/24-12/25 | 联合广场冬日仙境、公园圣诞节、海边大道冬日节、六旗魔术山公园假日、农场游戏、家庭徒步NeurIPS 2022 | 直面图的复杂性,港中文等提出面向图数据分布外泛化的因果表示学习
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。