小米发布并开源Xiaomi OneVL自动驾驶模型
小米开源了自动驾驶模型XiaomiOneVL,该框架首次将视觉语言模型与世界模型统一,显著提升了推理速度与精度。它在多项基准测试中刷新了性能纪录,并为决策过程提供了语言和视觉双维度的可解释性,既能解释驾驶决策,也能预测未来场景。
小米技术团队近日正式发布并开源了Xiaomi OneVL一步式潜空间语言视觉推理框架。这一方案在业内率先实现了将视觉语言模型、世界模型以及潜空间推理等多个技术路线统一于同一框架之下。它在继承扩展语言模型强大推理能力的同时,显著提升了推理的速度与精度,堪称一项具备开创性的工作。具体表现上,其精度超越了显式思维链方案,而在推理速度上则能与直接输出答案的潜空间思维链方案看齐。

回顾过往,视觉语言模型和世界模型在自动驾驶领域曾是两条相对独立的技术路径:前者专注于理解当前场景并输出驾驶决策,后者则擅长预测未来场景的演变。Xiaomi OneVL通过创新的潜空间推理技术,首次将这两大核心能力融合进了一套统一的框架之中。
在覆盖感知、推理与规划的多个主流评测基准上,Xiaomi OneVL全面刷新了潜空间推理方法的性能纪录。

如图所示,在ROADWork、Impromptu、Alpamayo-R1三项基准测试中均达到了当前最优水平,并在NA VSIM基准上取得了优越的性能表现。
更值得关注的是,Xiaomi OneVL为模型的决策过程提供了语言和视觉双维度的可解释性。这意味着,它不仅能以文字形式解释“为何做出这样的驾驶决策”,还能通过预测画面直观展示“接下来可能发生什么”。

上图清晰地展示了这种语言与视觉并行的可解释性输出。
目前,小米已将Xiaomi OneVL的模型权重、训练及推理代码全面开源,相关资源链接汇总如下:
技术报告:https://arxiv.org/abs/2604.18486
项目主页:https://Xiaomi-Embodied-Intelligence.github.io/OneVL
开源代码:https://github.com/xiaomi-research/onevl
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















