发布于2026-08-03 阅读(0)
扫一扫,手机访问
说实话,机器人训练这件事,长期以来最大的瓶颈是什么?数据。数据。还是数据。
但真实世界里采集数据,成本高、周期长,而且很难覆盖各种光照、背景、物体组合和不同的机器人本体。过去,不同类型的数据往往需要不同的模型分别生成,效率低得让人头疼。
小米最近放了个大招:正式发布了Xiaomi-Robotics-U0大模型(下称“U0”),而且直接开源了。这是具身智能领域里首个统一生成模型,380亿参数,首次把多项具身世界建模能力和通用图像生成能力统一到一套多模态自回归架构里。什么意思?等于给机器人训练数据的生成、迁移和扩增,提供了一个统一的底座——效率一下子就上来了。

U0的性能表现也很能打。在由清华大学、北京大学等机构联合打造的具身智能权威评测基准WorldArena上,U0拿到了73.64分,综合性能全球第一。真机测试的结果更有说服力:用U0生成的数据训练后,机器人就算到了从没见过的环境,任务完成进度平均提升了26.3%。这意味着什么?环境泛化能力——机器人从实验室走向真实世界、实现规模化应用必须突破的瓶颈,被实实在在地向前推了一大步。
U0的能力覆盖了四类核心任务,而且每一项都是实打实的硬功夫:
具身场景生成:根据文本描述,为指定机器人生成桌面、厨房、仓库等环境下的多视角初始观测;
具身迁移:把已有机器人轨迹迁移到新环境里,改变光照、背景、材质或物体的同时,保持机械臂姿态、动作轨迹和场景布局不变;
机器人交互视频生成:根据初始观测和操作指令生成后续视频,兼顾动作连贯性和物理一致性;
通用文生图与图像编辑:保留通用视觉生成与编辑能力,把互联网上已有的视觉知识迁移到具身智能任务中,进一步扩充训练数据的场景和物体类型。

这四类能力,把"生成场景—迁移轨迹—扩展环境—生成交互过程"这条数据生产链路完全贯通了。U0就像一座统一、可控、高效的"具身数据工厂"——不同的机器人、不同的场景、不同的任务,都能在这里找到对应的数据。
真机测试的结果进一步坐实了它的价值。在陌生光照、未知背景这些分布外场景里,用U0生成的数据训练后的机器人,任务完成进度平均提升了26.3%。说句大白话:就算换到训练阶段完全没见过的环境,机器人也能更稳定地完成任务。这才是关键所在。
给机器人"造"数据,和普通的AI画图有本质区别。画面不仅要逼真,更要和真实采集的动作轨迹严格对齐——同一个物体在不同相机视角下的位置必须几何一致,机械臂的姿态不能因为换了背景就错位。否则,生成的数据根本没法用来训练。
针对这个挑战,U0提出了五维解耦结构化控制范式。简单说,就是把机器人工作场景拆成五个维度:工作台布局、操作物体、无关物体、光照和背景。每个维度都能通过自然语言独立调整,修改前景、背景或光照的同时,尽量保持机械臂姿态、空间结构及多视角关系不变。
在WorldArena评测中,U0综合排名第一,指令遵循、交互质量和视角一致性三个子项也全部拿下第一。可控性得分91.60,3D准确性92.04。这些数据不是虚的。
在一项包含300个不同难度样本的对比测试中,U0在深度一致性、结构保真和语义对齐三个维度上都大幅领先GPT-Image 2.0。后者虽然也能生成符合文字描述的画面,但在跨视角场景里,更容易出现物体错位、空间畸变或机械臂姿态变化,导致生成数据与原始轨迹的对应关系出问题。


U0的优势,不只是"把画面生成得更像",更在于让机器人动作、空间关系和多视角观测保持一致,使生成的数据真正具备训练价值。
大规模生产具身数据,除了要求结果准确,速度和成本也是绕不开的坎。
U0提出的FlashAR+高速推理加速方案,结合对角并行解码与高效的缓存调度技术,能把一张可用高清训练图片(1024×1024分辨率)的生成时间,从原来的7.5分钟(450.77秒)极限压缩到5.44秒——效率提升了82.9倍。

这一效率提升,为具身训练数据的低成本、规模化生产提供了工程基础。机器人训练团队因而能在更短时间内,批量生成覆盖不同背景、光照、物体和机型的训练数据。随着U0开源,具身数据有望从依赖大量人工采集,真正走向可控、高效的批量生产。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9