当前位置:

首页 > 硬件相关 > 当AI开始"梦游":BITS比拉尼大学等机构联合打造的3D导航测试场

当AI开始"梦游":BITS比拉尼大学等机构联合打造的3D导航测试场

印度等多国机构联合发布SleepWalk基准,用于评估视觉语言模型将语言指令转化为三维路径的能力。该基准通过构建多难度导航任务,由AI从四个维度评分。测试发现,当前先进模型虽能规避障碍,但在精准执行指令方面仍有不足,凸显了AI在空间与语言对齐上的短板。


最近,一项关于AI“空间行动力”的研究引起了广泛关注。这项由印度BITS比拉尼果阿校区、印度人工智能研究组织(IAIRO)、孟加拉国达卡大学、德里理工大学,以及来自谷歌DeepMind和谷歌的研究人员共同完成的工作,于2026年5月以预印本形式发布在arXiv上,编号为arXiv:2605.10376。其核心成果,是一个名为SleepWalk的评测基准。这个基准的目的很明确:量化评估视觉语言模型在三维场景中,将一句简单的语言指令,转化为一条可执行、可落地的物理路径的能力。

当机器人“听懂了”但“走错了”

想象这样一个家庭场景:你对着智能机器人助手说:“去把沙发旁边的遥控器拿过来给我。”它或许会点头示意,表示理解。但接下来,它可能径直撞上茶几,或者停在沙发的另一侧,怎么也够不着遥控器。这听起来像科幻喜剧里的桥段,却精准地戳中了当前最先进的视觉语言模型(那些能同时“看图”和“理解文字”的AI)所面临的真实困境。

这类模型在图像描述、问答、指令跟随等任务上成绩斐然。然而,“能说清楚”和“能走对路”之间,存在着一道巨大的鸿沟。当AI需要真正进入物理世界,成为机器人的“大脑”时,它面临的挑战远不止“认出沙发在哪里”。它必须规划出一条从起点出发、绕开所有障碍、最终精准停在一个能伸手拿到遥控器的位置的完整路径。SleepWalk这个评测框架,就是为了精确测量这道鸿沟到底有多宽而设计的。其名字“梦游”颇具深意,暗示了当前AI在三维空间中的行动,更像是一种缺乏清醒空间认知的盲目摸索。

一、从一张文字描述,到一个可以“走进去”的三维世界

构建SleepWalk测试的第一步,是创建逼真的三维考场。研究团队从著名的图像数据集MS-COCO中抽取了原始的场景文字描述,经过人工筛选和精心改写,最终得到了1200条适合生成单一、连贯场景的描述,涵盖室内和室外环境。

这些文字描述随后被喂给一个名为Hunyuan3D-3.0的三维场景生成系统。这个过程,好比一位效率极高的虚拟建筑师:你给它一段话,比如“一家墙壁和地板都很舒适的书店,里面有书架、梯子、阅读椅和收银台,陈列丰富”,它就能根据描述,自动估算空间布局、物体摆放和整体几何结构,生成一个完整的三维环境。

为了确保这些生成的环境能真正用于测试“行走”能力,团队对每一个场景都进行了严格的人工筛选。标准包括:场景必须在视觉和空间上连贯;必须有足够的空地供一个人形智能体移动;主要物体必须能从渲染图像中被清晰识别;任何出现严重几何错误(如物体悬浮、穿模)的场景都会被直接剔除。

经过层层筛选,最终保留了2472个高质量的三维环境。对于每个场景,团队都渲染出两张关键图像:一张是正上方的“鸟瞰图”,清晰展示平面布局和障碍物分布;另一张是带倾斜角度的“斜视图”,更好地呈现物体外观和交互细节。这两张图,共同构成了AI模型在执行任务时所能“看到”的全部视觉信息。

这种聚焦于单一场景内部的设计是刻意为之的。与以往让AI在多个房间穿梭的导航测试不同,SleepWalk压缩了探索范围,将焦点集中在更精细的局部推理上——在一个摆满家具杂物的空间里,AI能否找到正确目标、规划出安全路径、并在恰当的位置停下?这恰恰是现实世界中机器人助手最常遇到的挑战。

二、九道题、三个难度,测的是“越说越难懂”的指令

有了场景,下一步是为每个场景设计考题。研究团队使用了另一个视觉语言模型Qwen3-8B-VL来生成任务。这个模型同时观察鸟瞰图和斜视图,并被要求生成九条不同的导航指令,按难度分为三个等级,每级三条。

简单任务要求直接的、单目标移动,例如“从书架走到墙上的灯”。这类任务的关键在于正确识别起点和终点的位置,路径规划相对简单。

中等任务开始引入组合要素,比如“走向那个黄色球形物体,然后移动到北边的树”。这要求AI不仅要识别两个不同目标,还要按正确顺序依次抵达,并将“先……再……”的时间逻辑体现在路径规划中。

困难任务则进入了真正的多步骤交互领域,例如“从服务台拿起托盘,走到圆桌,把它放在那里”。这不仅涉及三个不同的物体和位置,还包含了拿取、搬运、放置等动作序列,要求AI规划出完整的行动链条,并确保终点位置支持放置动作。

指令生成过程设置了严格约束:起点和终点必须对应场景中真实可见的具体物体;禁止使用“左边”、“右边”等依赖观察者视角的模糊方向词;所有提及的物体必须在画面中存在。这套三级设计的逻辑很清晰:随着任务难度提升,所需的推理能力从“识别目标位置”,升级到“把握多个目标的空间与时间关系”,再升级到“规划包含具体动作约束的完整序列”。每一级都在增加新的认知负担。

三、让AI“画出”路径:轨迹预测任务的设计

SleepWalk的核心考核内容是轨迹预测。每个被测模型会同时接收到两张场景图像和一条语言指令,然后需要输出一条具体的行走路径。

这条路径由一系列三维坐标点表示。场景被离散化为一个25×25×25的网格,模型需要输出从起点到终点经过的每一个中间坐标。一条合格的路径必须满足三个条件:全程位于场景空间范围内;不能穿过任何障碍物;终点位置必须支持指令要求的动作(例如,要能“拿起”物体,终点就必须足够靠近且无障碍)。

这个设计的关键在于,它评估的是整条路径的每一步合理性,而不仅仅是终点是否正确。传统的导航测试往往只看最终结果,就像考试只看答案对错,不管解题过程。SleepWalk要求的是一份完整的、经得起推敲的“解题步骤”。所有模型均在零样本条件下测试,确保结果反映的是其原生能力,而非针对测试的临时优化。

四、用AI当考官:轨迹评分的四维标准

模型输出路径后,如何打分?研究团队设计了一套基于AI评判模型的评分协议,选用GPT-5-mini担任“考官”。

考官会看到三样东西:场景鸟瞰图、导航指令,以及模型预测的路径(在鸟瞰图上以绿色星形标记路径点,绿色圆点标记起点,红色圆点标记终点)。基于这些信息,考官从四个独立维度打分,每个维度1-5分:

1. 起点准确性:路径是否从正确的初始区域出发。
2. 目标完成度:路径终点是否真正到达指令要求的位置,并支持所述动作。
3. 障碍物规避:路径是否绕开了所有明显障碍。
4. 路径效率:路径是否足够直接,没有不必要的绕路。

有效分数归一化后,先在同一难度等级内平均,再跨三个难度等级平均,得到每个维度的总体得分。这套体系能区分“没撞墙但走错了地方”和“找对了地方但绕了远路”等细节差异,比简单的对错二分更精细。当然,依赖AI评判模型本身也存在局限,其可靠性目前缺乏系统性的人工标注验证。

五、三个选手上场:GPT-5-mini、Qwen3-VL、Gemini Robotics ER-1.5

研究团队选取了三个前沿视觉语言模型参与测试:Qwen3-VL、Gemini Robotics ER-1.5和GPT-5-mini。它们在完全相同的条件下接受考核。

从整体得分看,GPT-5-mini在四个维度上均领先:起点准确性(0.75)、目标完成度(0.51)、障碍物规避(0.91)、路径效率(0.64)。Gemini Robotics ER-1.5居中,Qwen3-VL得分相对最低。

这组数据揭示了一个有趣的现象:三个模型在“障碍物规避”上都表现尚可(最低也有0.84),但在“目标完成度”上却集体表现不佳(最高也只有0.51)。这就好比打靶:模型都能把子弹打在靶场范围内(不撞墙),但能否命中靶心(精准到达正确位置)就是另一回事了。前者考验的是生成一条“看起来合理”的路,后者考验的才是真正理解指令并精准对齐空间位置的能力——而这正是当前的短板。

六、越难越崩:三个等级之下的系统性衰退

按难度细分的结果,揭示了一个清晰的规律:随着任务从简单、中等升级到困难,所有模型的表现均出现下滑,且下滑幅度在需要多步骤推理和交互约束的任务中尤为剧烈。

在简单任务(如“从书架走到墙上的灯”)中,模型能大体理解语义并规划方向,但路径常过于贴近物体,存在潜在碰撞风险。这表明,即使是最简单的任务,模型也未能完全弥合“语义理解”与“物理可行性”之间的裂缝。

中等任务(如“走向黄色球形物体,然后移动到北边的树”)的主要挑战在于组合性推理。模型常常无法正确绑定多个参照物到其空间角色,或保持正确的时间顺序,失败模式多为起点或终点定位错误。

困难任务(如“从服务台拿起托盘,走到圆桌,把它放在那里”)引入了显式的物体交互和多步规划。即便是表现最好的模型,在理解“在哪里执行放置动作”这类精确要求时,也显示出明显局限。

综合来看,失败模式可归纳为三类:起点定位偏差、目标定位不完整或错误,以及路径语义通顺但物理上不安全(可能导致碰撞或无法完成动作)。

七、让路径“活起来”:人形机器人动作验证

除了静态评分,团队还进行了一项额外的可视化验证:将GPT-5-mini预测的路径,导入真正的人形运动动画中进行模拟。

具体方法是,先将路径坐标序列输入TLControl系统,转换为低级别运动控制信号;再用MotionGPT系统根据这些信号生成逼真的全身动作动画。这一步的价值在于,它能暴露纯鸟瞰图分析无法发现的问题:一条在平面上看似无误的路径,在三维执行时可能会近距离掠过障碍、停在肢体无法舒适动作的位置,或产生不自然的运动过渡。

这个阶段主要用于定性理解,而非主要评分依据。它像一台高倍显微镜,帮助研究者洞察单靠分数无法捕捉的失败细节,搭建起从“几何正确”到“具身可行”的认知桥梁。

八、这个测试框架本身有哪些局限?

研究团队在论文中坦诚列出了SleepWalk的几个局限,体现了其严谨性。

首先,所有场景均基于文字描述生成,是合成环境而非真实世界扫描。这意味着物理细节(如重量、摩擦力)仅为近似,无法完全反映现实复杂性。其次,主要评分依赖AI评判模型,虽有多维度标准,但缺乏系统性人工核验,结果存在不确定性。第三,鸟瞰图叠加路径的可视化是一种简化,无法捕捉具身执行的全部细节。

此外,论文对从“1200条描述”到“2472个环境”的具体转化过程描述可更详细。目前仅评测了三个模型,未来需要覆盖更广泛的模型类型以得出更普遍的结论。

说到底,这场“梦游测试”告诉了我们什么

归根结底,SleepWalk所做的工作,是在AI系统真正踏入现实世界之前,进行一场严格的预演检验。

测试结果清晰地表明,当前顶尖的视觉语言模型在“不撞墙”方面已做得不错,但在“走对地方”这件事上仍力有未逮。更深层的问题在于,模型尚未完全掌握将语言指令与物理空间进行精确对齐的能力——即理解“指令所说的具体是哪个位置,以及到达后身体该如何摆放”。

对于未来要进入家庭和工厂的机器人而言,这种能力至关重要。一个只能“大概走到附近”的机器人,在现实中可能导致碰撞、无法操作甚至引发事故。SleepWalk的价值,就在于提供了一种可量化、可重复、可扩展的方法,来测量现有系统与这一目标之间的实际距离。

研究也指出了几个值得探索的方向:丰富输入信息(如多视角、时序观察);在结构化三维场景表示上直接推理;将路径预测与底层运动控制更紧密结合;将框架迁移至物理仿真器,支持从仿真到现实的能力迁移。

这项研究促使我们思考的,不仅是AI技术的进步方向,更是评估AI能力时是否问对了问题。能描述、能识别、能说出意图,与能真正在环境中行动,中间隔着一道尚未被完全量化的鸿沟。SleepWalk的价值,正是将这道鸿沟清晰地量化出来,使其从一个模糊的直觉,变成一个可以持续追踪进展的具体标尺。

Q&A

Q1:SleepWalk测试框架和普通的视觉语言导航测试有什么不同?
A:SleepWalk专注于单一场景内的局部精细推理,要求模型输出完整路径而非仅仅到达终点,并评估路径每一步的物理合理性与动作可执行性。传统导航测试更关注跨房间长距离探索,且常以终点到达作为单一成功标准,容易掩盖路径规划本身的问题。

Q2:SleepWalk的评分为什么不用距离这样的几何指标,而要用AI当评判模型?
A:因为路径的正确性不仅是几何问题,还涉及动作语义。例如,“停在能够拿到物体的位置”这种判断,仅靠坐标距离无法完成。使用GPT-5-mini作为评判模型,能同时理解语言指令和视觉场景,对路径是否真正完成任务给出综合判断,弥补了纯几何指标的不足。

Q3:SleepWalk测试出来的AI最大弱点是什么?
A:测试结果显示,模型在障碍物规避上得分较高,但在目标完成度上得分很低。这说明当前模型的主要短板不是生成一条“看起来合理”的路径,而是精准地将语言指令对应到正确的空间位置,并停在一个真正支持执行指定动作的地点。精准的空间-语言对齐能力仍是关键瓶颈。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。