小米汽车发布世界模型全新框架,主流基准测试全面SOTA
今天,小米汽车发布了一项名为Xiaomi Auto World Model的全新框架,为业界辅助驾驶世界模型的发展提供了一条新路径。这标志着行业正从基础的“场景感知”,朝着“认知推演、场景进化”的高阶形态迈进。 简单来说,这个框架的核心突破在于,它首次将三维重建与视频生成深度耦合,形成了一个一体化架
今天,小米汽车发布了一项名为Xiaomi Auto World Model的全新框架,为业界辅助驾驶世界模型的发展提供了一条新路径。这标志着行业正从基础的“场景感知”,朝着“认知推演、场景进化”的高阶形态迈进。

简单来说,这个框架的核心突破在于,它首次将三维重建与视频生成深度耦合,形成了一个一体化架构。其核心理念可以概括为“重建锚定几何,生成填补想象”。这种新范式,打破了行业长期将重建和生成作为两条独立技术路线的惯例。
从实际效果看,这套框架在Waymo、nuScenes等主流基准测试中已全面取得SOTA(当前最优)成绩。更重要的是,它并非停留在实验室阶段,而是已经在小米汽车的合成数据生成、仿真测试以及智能座舱这三大核心业务场景中完成了落地应用。
▲ Xiaomi Auto World Model 效果展示
要理解这个框架的价值,得先看看当前世界模型的两条主流技术路线:重建(WorldRec)与生成(WorldGen)。
重建路线的优势在于“求真”。它从多视角的观测数据中恢复出几何精确的3D场景,保真度高,一致性也强。但它的短板也很明显:只能还原已经看到的内容,缺乏对未知或未来场景的“想象力”。
生成路线则擅长“想象”。它通过扩散模型等技术,可以直接预测未来的画面,能够生成未观测到的视角和未发生过的场景。但问题在于,它缺乏显式的3D结构支撑,在长时序的推演中,画面容易漂移、失真,就像凭空想象容易“跑偏”。
那么,有没有办法把两者的优势结合起来,同时规避各自的短板呢?Xiaomi Auto World Model给出的答案就是深度耦合。
这个框架让重建模块和生成模块在结构上互相约束、协同工作。重建模块提供精确的3D几何结构,作为整个系统的“结构化锚点”,为生成过程提供稳定性约束;而生成模块则将预测能力延伸到观测范围之外,弥补了重建模块的想象力边界。
两者形成了一个闭环,互相增益,最终在三个关键维度上实现了“1+1>2”的效果:
高稳定性:重建提供的确定性几何约束,有效抑制了长时序自回归推演中常见的误差累积和内容漂移问题。
高一致性:通过4D场景表征作为跨帧共享的“记忆”,确保了不同时刻、不同视角下的场景内容在全局范围内保持一致。
高真实性:生成模块以重建渲染出的RGB图像为“几何骨架”,使得合成的内容既符合物理世界的空间布局,又贴近真实传感器的观测效果,从而显著缩小了“仿真”与“现实”之间的领域鸿沟。
▲ WorldGen 的极端场景效果
技术最终要服务于应用。目前,Xiaomi Auto World Model已经在小米汽车的三大实际业务场景中发挥了作用:
合成数据生成:已经交付了超过10万段高质量合成数据,直接用于训练车辆的感知模型。这尤其有助于提升车辆在那些危险、罕见场景下的识别与应对能力。
仿真测试:基于该框架构建了闭环仿真环境,不仅优化了测试效率,完善了测试规范,更重要的是,能够在仿真中精准复现真实世界的事故场景,从而进行定向的算法优化。
辅助驾驶学堂:利用世界模型的动态生成能力,可以创建第一人称的驾驶教学视频。当用户面对复杂路况时,系统能够以生成式视频直观展示正确的操作方式。目前,这项功能已经以“实景模拟场景”的形式,上线于小米全系车型的辅助驾驶学堂中。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















