商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 蚂蚁正式开源 LingBot-Depth,基于掩码深度建模的新一代空间感知模型

蚂蚁正式开源 LingBot-Depth,基于掩码深度建模的新一代空间感知模型

  发布于2026-08-17 阅读(0)

扫一扫,手机访问

灵波科技开源的这款LingBot-Depth模型,说起来很有意思——它瞄准的是深度补全这个行业中公认的硬骨头。如果你的机器人或自动驾驶设备用着3D相机,一定遇到过那种深度图上突然多出来一个黑洞,或者反光物体直接“隐身”的情况。没错,这些问题背后的核心技术难题,就是LingBot-Depth想要解决的核心课题。

简单来说,这个模型是一个专为真实应用场景设计的深度补全方案。它基于奥比中光Gemini 330系列双目相机完成数据采集,并且直接利用深度引擎芯片输出的原始深度数据进行训练和调优。这就好比给了大脑一本没有删减的原始笔记,而不是已经被人整理过、可能丢掉了关键细节的摘要。目标很明确:把那些有缺失、有噪声的原始深度信号,重建为高保真、具备真实物理尺度的三维测量结果。换句话说,就是让智能体真正“看懂”周围环境。

LingBot-Depth 核心优势

  • 高精度与高鲁棒性的相机深度感知能力
  • 优异的 3D 静态感知与 4D 动态场景理解性能
  • 支持对透明、反光等难抓取物体的灵巧操作

实验数据相当能打。在深度预测精度和有效像素覆盖率这两个关键指标上,它全面超越了当前主流工业级深度相机。在NYUv2、ETH3D等权威基准测试中,LingBot-Depth在深度补全、单目深度估计以及双目立体匹配任务中都达到了SOTA水平。更值得玩味的是,它在没有引入显式时序建模机制的情况下,依然能保持视频序列级的时间一致性。这意味着什么?意味着模型在单帧就能感知深度,但多帧之间还能稳得住,不会出现闪烁和抖动。

上面这张图展示的是最难的稀疏深度补全任务中的表现——数值越小越好,而LingBot-Depth的线几乎贴着底边走。下游任务的实测结果同样令人信服:模型在RGB和深度两种模态之间学到了高度对齐的隐空间表征,能可靠地识别并抓取透明杯子和镜面反射物体。这在实际场景中可是个不小的突破。

技术上的核心亮点,研发团队称之为“掩码深度建模”(Masked Depth Modeling,MDM)。思路其实和掩码语言模型有点像:训练数据是大规模的RGB–深度图像对,但训练过程中会主动把部分深度区域随机遮蔽掉,逼迫模型只靠RGB图像内容去推理被遮挡的深度信息。随着训练推进,模型会逐步建立起“外观—几何结构”之间的强关联映射——说白了,就是从物体的长相出发,直接推断它在哪、离你有多远。这个机制才是模型能泛化到透明和反光物体的底层原因。

值得一提的是,模型权重、训练/推理代码以及技术白皮书目前均已面向全球开发者开源(相关链接可从官方渠道获取)。无论你是做服务机器人、自动驾驶,还是工业检测,都可以直接拿来用在自己的项目里。

本文转载于:https://www.php.cn/faq/2036690.html?uid=1246273 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注