商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 英伟达推出LocateAnything,主打AI高速、高精度检测对象

英伟达推出LocateAnything,主打AI高速、高精度检测对象

  发布于2026-05-30 阅读(0)

扫一扫,手机访问

说起机器人和AI智能体的视觉能力,过去大家关注的是能不能“看见”,但现在,真正的问题是:看见了,能多快找到目标?这不,英伟达昨天(5月29日)联合香港理工大学、南京大学等机构,正式推出了一个名为 LocateAnything 的新模型,目标就是解决这个“快”字。

简单来说,这个模型可以从一张照片或截图中,快速找出你指定的那个对象,并用一个检测框把它标出来。听起来不算新鲜?关键在于,它把速度和精度都推到了一个非常高的水平,特别适合机器人感知、电脑自动操作这类需要即时响应的场景。


英伟达在介绍中强调了一个核心观点:机器人和AI智能体光能“看见”还不够,还得在眨眼间确认目标在哪。为此,LocateAnything 整个设计围绕“检测框预测”重新构建,让视觉语言检测真正适应即时交互任务。


为了实现这种高速检测,团队提出了一个叫 Parallel Box Decoding(并行框解码)的技术。思路是把边界框或点当作固定长度的原子单元,一次预测就能输出 x1、y1、x2、y2 四个坐标值,一步到位。

围绕这个框架,LocateAnything 提供了三种运行模式:

Fast Mode,主要面向端侧机器人和具身智能,追求高吞吐;Slow Mode,偏向离线标注和高精度评测,适合追求完美的场景;而 Hybrid Mode,默认状态下快速输出,一旦遇到格式异常或空间歧义,能自动切换回自回归解码来保证准确性。这套组合拳,说白了就是“平时快,遇事稳”。

当然,这么强的能力背后,是海量数据的支撑。研究团队构建了一个名为 LocateAnything-Data 的训练集,包含1200万张独立图像、1.38亿条语言查询以及7.85亿个边界框。数据覆盖了通用检测、GUI元素定位、指代表达理解、OCR文字定位、版面定位和点定位等多种场景,极大扩展了模型的训练视野。



速度到底有多快?直接看数据:在单张NVIDIA H100 GPU上,LocateAnything 默认使用 Hybrid Mode 能达到每秒12.7个框(Boxes Per Second)。作为对比,Qwen3-VL 只有1.1 BPS,而 Rex-Omni 是5.0 BPS。差距非常明显。


而在高精度任务上,LocateAnything 也表现得毫不含糊。在 LVIS 数据集的 IoU=0.95 严格标准下,得分31.1,远高于 Rex-Omni 的20.7。在 ScreenSpot-Pro 上平均 F1 达到60.3, DocLayNet 和 M6Doc 两个文档理解任务上也分别拿到了76.8和70.1的成绩。

总之,这个模型把“快”和“准”结合得相当紧密,值得关注。

本文转载于:https://www.163.com/dy/article/KU6193M10511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注