单目机器人也能抓起透明物体了
机器人精准抓取透明物体难题攻克!仅需单张图像,单目视觉即可实现!这项突破性成果由地瓜机器人和中科院自动化所等单位合作完成,其核心是名为MODEST的新型算法框架。该框架是一个多任务模型,能够同时进行透明物体的深度估计和语义分割。MODEST作为通用抓取模型的前端模块,无需额外传感器,即可高效、灵活地实现透明物体的抓取。相比其他双目或多视图方法,其效果更佳。这项技术可广泛应用于智能制造、实验室自动化和智慧家居等领域,显著提升机器人操作透明物体的能力,并降低设备成本。MODEST已入选ICRA20
机器人精准抓取透明物体难题攻克!仅需单张图像,单目视觉即可实现!
这项突破性成果由地瓜机器人和中科院自动化所等单位合作完成,其核心是名为MODEST的新型算法框架。该框架是一个多任务模型,能够同时进行透明物体的深度估计和语义分割。

MODEST作为通用抓取模型的前端模块,无需额外传感器,即可高效、灵活地实现透明物体的抓取。相比其他双目或多视图方法,其效果更佳。

这项技术可广泛应用于智能制造、实验室自动化和智慧家居等领域,显著提升机器人操作透明物体的能力,并降低设备成本。MODEST已入选ICRA 2025(IEEE机器人与自动化国际会议)。
挑战与突破
透明物体抓取的难点在于获取其准确的深度信息。传统方法依赖深度传感器或多视角重建,成本高且效率低。透明物体的折射和反射特性,以及在图像中缺乏清晰纹理等问题,都增加了感知难度。
MODEST框架创新性地解决了这些问题,它通过结合语义和几何信息的多任务框架,准确获取透明物体的深度信息,并结合点云抓取网络实现抓取。

算法详解
MODEST模型以单目RGB图像为输入,输出透明物体的分割结果和场景深度预测。其核心由编码、重组、语义几何融合和迭代解码四个模块构成。

基于注意力机制的语义几何融合模块,充分利用语义分割和深度估计任务间的互补信息,提升了整体性能。 此外,受人眼视觉启发,MODEST采用由粗到细的特征更新策略,进一步提高了预测精度。

实验结果
在Syn-TODD和ClearPose两个公开数据集上的实验表明,MODEST在深度估计和语义分割方面均显著优于其他先进方法,即使在人眼难以判断的场景下也能产生清晰的预测结果。

真实机器人平台的抓取实验也验证了MODEST的鲁棒性和泛化性。
其他成果及资源
除了MODEST,地瓜机器人研发的DOSOD开放词汇目标检测算法也入选ICRA 2025。 感兴趣的读者可访问以下链接了解更多信息:
MODEST文章地址:https://arxiv.org/pdf/2502.14616 MODEST代码地址:https://github.com/D-Robotics-AI-Lab/MODEST DOSOD文章地址:https://arxiv.org/abs/2412.14680 DOSOD代码地址:https://github.com/D-Robotics-AI-Lab/DOSOD?tab=readme-ov-file

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















