商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境

  发布于2026-08-21 阅读(0)

扫一扫,手机访问

视觉-语言-动作(VLA)模型有个老毛病:部署时只要相机角度、安装位置或者机器人本体稍微变一变,性能就可能直线下滑。过去常用的“上下文学习”多半是把上下文当示范用——让机器人看人类做一遍任务,但它并不清楚整套系统到底怎么运作的。一旦环境变了,研究人员只能回头重新收集数据、重新调模型,又费时间又费力气。 针对这个问题,复旦大学邱锡鹏团队拿出了一个新方案——“上下文世界建模”(In-Context World Modeling,ICWM)。核心思路很简单:在任务执行之前,让机器人先来一段跟任务无关的随机探测动作,然后把这段交互过程作为上下文喂给模型,让它自己判断当前系统的配置。这样一来,后续的动作生成就不用重新示范,也不用调整模型参数。


论文链接:https://arxiv.org/abs/2606.26025 仿真和真实机器人实验都显示,ICWM 的整体表现显著优于现有方法。它只需要少量随机探测动作,就能在零额外示范、零参数更新的情况下适应新环境,跨视角和跨配置的泛化能力也明显提升。

ICWM 是如何设计的?

与传统 VLA 模型相比,ICWM 的核心变化在于:它先根据交互上下文判断当前系统配置,然后再生成后续动作。整个流程分训练和推理两个阶段。 **训练阶段**:团队在每个任务样本前面拼接一段与任务无关的交互片段,作为上下文输入。模型根据交互带来的画面变化,推断当前系统的配置。有意思的是,ICWM 没有单独搞一个独立的世界模型,而是直接用 VLA 主干来处理这段交互历史。这么做既简化了结构,也让信息能直接为动作预测服务。 **推理阶段**:机器人不急着干活,先做一轮主动探测——记录动作前后的观测变化,形成所谓的“交互上下文”。然后模型把当前看到的上下文、画面和任务指令一起作为输入,判断接下来该怎么做。


图|ICWM 的训练与推理流程概览。

实验结果

团队在跨视角、真实机器人和多种分布外扰动场景上都做了实验。结果表明,ICWM 借助交互上下文大幅提升了对新环境的适应能力,并且展现出向语义变化和机器人形态变化等场景扩展的潜力。

1. 仿真结果

在 LIBERO 仿真基准上的跨视角实验中,ICWM 在已见视角和新视角下都优于基线。相比单纯靠多视角训练的方法,它在已见视角下平均高出 8.1%,在新视角下平均高出 13.0%。即使直接把真实相机参数输给模型,它的泛化表现仍然不如 ICWM。在长时序任务上,ICWM 对累积误差的控制也更出色。


图|在 LIBERO 基准上,已见视角与未见视角的成功率(%)。

2. 真实机器人实验

在 UR5e 真实机器人平台上,ICWM 同样明显优于基线。团队用了一套 12 相机的多视角系统评估,任务覆盖堆叠、抓取和拾取、放置等操作。标准 VLA 对视角变化相当敏感——从训练视角切换到测试视角后,平均成功率从 68% 骤降到 17%,而 ICWM 的表现稳定得多。


图|在 UR5e 平台上的真实世界评测。

定性结果也很有意思:切换到新环境后,普通模型容易出现位置偏移、过早闭合夹爪等问题,ICWM 则基本保持稳定。


图|定性对比。

3. 消融与分析

消融实验证实,ICWM 的性能提升确实来自交互上下文,而不是简单的模式匹配。去掉图像信息后,模型表现下降最明显——平均成功率从 25.0% 降到 10.9%;去掉动作信息,或者不提供交互上下文,模型表现也会下降。更有意思的是,如果给一段错误的上下文,模型表现甚至比没有上下文时还差。对照实验还表明,模型必须经过专门训练才能利用交互上下文适应环境;否则,就算在测试时提供同样的信息,性能也几乎为零。


图|交互上下文消融实验。

从可视化结果来看,模型已经能区分不同视角和配置:相同视角下的数据分布更集中,不同视角之间的区分也更清晰。


图|不同分布外(OOD)视角下的 Ψ(T) 的 t-SNE 可视化。

团队还发现,ICWM 的效果并不依赖某一种特定的探测方式。无论采用随机探测,还是仅沿 XY、Z 或旋转方向运动,ICWM 都稳定优于对照方法,成功率提升约 15% 到 27%。泛化实验也显示,ICWM 对机器人形态变化有较强的适应性,在语义扰动场景下同样有一定提升。


图|分布外(OOD)视角下,不同探测策略的成功率(%)。


图|对语义场景变化和机器人形态变化的鲁棒性。

不足与未来方向

ICWM 虽然显著提升了 VLA 在新环境中的适应能力,但团队也指出了几个短板。 首先是极端视角问题。在部分极端视角条件下,ICWM 的性能提升仍然有限。原因是这些视角往往伴随更严重的遮挡,操作目标在执行过程中也更容易短暂移出相机视野。后续需要结合多视角感知、主动视角调整以及更强的遮挡建模能力来突破。 其次是语义扰动场景。目前 ICWM 在这类场景下的提升仍比较有限——训练数据中的场景语义和组合配置还不够丰富。如果能进一步扩充场景语义和组合配置更丰富的训练数据,ICWM 在语义扰动场景中的表现有望继续提升。 更多技术细节,详见原论文。
本文转载于:https://www.163.com/dy/article/L0MR6S230531E3NX.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注