发布于2026-05-29 阅读(0)
扫一扫,手机访问
小米技术团队近日正式发布并开源了Xiaomi OneVL一步式潜空间语言视觉推理框架。这一方案在业内率先实现了将视觉语言模型、世界模型以及潜空间推理等多个技术路线统一于同一框架之下。它在继承扩展语言模型强大推理能力的同时,显著提升了推理的速度与精度,堪称一项具备开创性的工作。具体表现上,其精度超越了显式思维链方案,而在推理速度上则能与直接输出答案的潜空间思维链方案看齐。

回顾过往,视觉语言模型和世界模型在自动驾驶领域曾是两条相对独立的技术路径:前者专注于理解当前场景并输出驾驶决策,后者则擅长预测未来场景的演变。Xiaomi OneVL通过创新的潜空间推理技术,首次将这两大核心能力融合进了一套统一的框架之中。
在覆盖感知、推理与规划的多个主流评测基准上,Xiaomi OneVL全面刷新了潜空间推理方法的性能纪录。

如图所示,在ROADWork、Impromptu、Alpamayo-R1三项基准测试中均达到了当前最优水平,并在NA VSIM基准上取得了优越的性能表现。
更值得关注的是,Xiaomi OneVL为模型的决策过程提供了语言和视觉双维度的可解释性。这意味着,它不仅能以文字形式解释“为何做出这样的驾驶决策”,还能通过预测画面直观展示“接下来可能发生什么”。

上图清晰地展示了这种语言与视觉并行的可解释性输出。
目前,小米已将Xiaomi OneVL的模型权重、训练及推理代码全面开源,相关资源链接汇总如下:
技术报告:https://arxiv.org/abs/2604.18486
项目主页:https://Xiaomi-Embodied-Intelligence.github.io/OneVL
开源代码:https://github.com/xiaomi-research/onevl
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9