商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 小米开源自动驾驶模型实现VLA与世界模型技术的统一

小米开源自动驾驶模型实现VLA与世界模型技术的统一

  发布于2026-05-28 阅读(0)

扫一扫,手机访问

自动驾驶的技术路线,过去常常给人一种“分道扬镳”的感觉。一边是视觉语言动作模型,专注于理解当下场景并输出驾驶指令;另一边是世界模型,致力于预测未来环境的演变。两者各有侧重,但能否合二为一,实现更高效、更强大的推理?小米技术最新开源的Xiaomi OneVL一步式潜空间语言视觉推理框架,给出了一个开创性的答案。

简单来说,这个模型做了一件业内率先实现的事:它将VLA、世界模型以及潜空间推理这几条关键技术路线,统一到了同一个框架之下。这意味着,它既继承了大型语言模型强悍的推理能力,又在推理速度和精度上取得了显著突破。官方数据显示,其精度超越了显式思维链方案,而在速度上,则能与直接输出答案的潜空间思维链方案看齐。

那么,这种统一具体是如何实现的?核心在于“潜空间推理”。传统的显式推理需要模型一步步“思考”并输出中间过程,而潜空间推理则将这些复杂过程压缩在模型内部的高维空间中完成,直接输出结果。Xiaomi OneVL正是利用这一特性,首次将场景理解与未来预测统一到了同一套潜空间框架中,让模型能同时处理“现在该做什么”和“接下来会怎样”这两个核心问题。

效果如何?数据是最直接的证明。在涵盖感知、推理与规划的多个主流基准测试中,Xiaomi OneVL全面刷新了潜在推理方法的性能上限。

▲ 在 ROADWork、Impromptu、Alpamayo-R1 三项基准上均达到 SOTA,在 NA VSIM 上取得优越性能

更值得关注的是,这个模型还解决了AI决策的“黑箱”难题。它能够为每一次决策提供双维度的可解释性:既可以用自然语言解释“为什么这样开”,也能用生成的视觉画面展示“接下来会发生什么”。这种“既说得清,又看得见”的能力,对于构建可信、可靠的自动驾驶系统至关重要。

▲ 为模型决策提供语言以及视觉的可解释性

目前,小米已经将Xiaomi OneVL的模型权重、训练及推理代码全面开源,旨在推动整个领域的研究与应用。相关资源汇总如下:

  • 技术报告:https://arxiv.org/abs/2604.18486
  • 项目主页:https://Xiaomi-Embodied-Intelligence.github.io/OneVL
  • 开源代码:https://github.com/xiaomi-research/onevl
本文转载于:https://www.itren.com/digital/178722.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注