商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 腾讯机器人X团队打造"会思考也会想象"的机器人大脑——RxBrain

腾讯机器人X团队打造"会思考也会想象"的机器人大脑——RxBrain

  发布于2026-07-29 阅读(0)

扫一扫,手机访问

假设你面前有两个场景:一个是教一个孩子学骑自行车,另一个是教一个机器人完成同样的任务。孩子看几眼示范,心里大概就明白了——“要往前蹬,得保持平衡”。而机器人呢?它需要被明确告知每一个步骤,甚至得提前“想象”自己完成任务之后,周围的世界会变成什么样子。这种“既能规划步骤,又能提前在脑海中预见结果”的能力,恰恰是现阶段人类与大多数机器人之间最本质的差距之一。

腾讯机器人X团队、富田实验室与腾讯混元团队联合发布了一项研究,他们提出了一个名为Hy-Embodied-RxBrain(简称RxBrain)的具身认知基础模型。这个模型的目标很明确:让机器人在制定行动计划时,不仅能像念菜谱一样列出“第一步做什么、第二步做什么”,还能在“脑海”中同步生成每一步执行完成后,世界应该是什么样的画面——就像一个有经验的厨师,不仅知道菜谱上写着“先把洋葱炒软”,而且在动手之前,就能清晰地预见到锅里那金黄透明的洋葱应该呈现出的状态。

这项研究真正的突破点在于:它是业界第一次真正把“说”和“想”这两件事,在同一个规划序列里耦合起来,而不是让它们分别工作完再拼合结果。

一、为什么机器人既要“说”也要“想”?

当前,机器人智能系统大致可以分成两类。一类是视觉语言模型,它们擅长理解眼前的画面、听懂人类指令、并分解任务步骤。它们能用语言告诉机器人“先拿起杯子,再把杯子放到托盘上”。但这类模型的短板在于,它们描述计划时完全停留在语言层面,对于“拿起杯子之后世界应该长什么样”缺乏清晰的视觉预见——就像一个从未下过厨房的人照着菜谱念步骤,却没见过菜完成时应有的样子。

另一类是生成式世界模型,它们善于预测动作执行后的画面,能生成“机器手臂伸过去抓住杯子后”的视频片段。但这类模型通常不擅长进行因果推理、理解各种约束条件,或是进行长程的逻辑规划。它们更像一台擅长渲染画面的摄影机,却没有导演的脚本意识。

RxBrain的思路是:让语言和视觉像乐队里的指挥和乐手一样配合工作。语言负责告诉机器人整首曲子的结构——哪一段先演奏、哪里要停顿、整体节奏是什么;视觉想象则负责把每一段旋律“奏出来”,让抽象的乐谱变成实实在在的声音。在RxBrain的规划序列中,语言描述行动步骤、约束条件和决策逻辑,而视觉想象则为每一个步骤生成对应的“世界状态图”——执行完这步之后,眼前的场景应该是什么样子。两者互为补充,缺一不可。

二、RxBrain的“大脑结构”是怎么搭建的?

RxBrain建立在一种叫做混合变换器架构(Mixture-of-Transformers,简称MoT)的技术框架上。你可以把这个架构理解成一座分工明确的大型办公楼:楼里有专门处理文字的部门、专门理解图片的部门、专门生成图片的部门。但这三个部门共享同一套会议室——也就是说,不同部门之间可以充分交流信息,但各自的专业工作又不会相互干扰。

具体来说,RxBrain包含三类主要工作单元。语言变换器负责处理所有文字,包括理解人类指令和生成规划步骤的文字描述;视觉变换器负责理解输入的图像和视频,理解和生成的视觉内容共享同一套“注意力机制”,同时各自有独立的前馈网络。此外,还有一个专门负责“视觉生成”的模块,它的处理容量特意做得更大——中间层宽度从6144扩展到12288,因为凭空生成一张有意义的画面,比理解一张已有的画面更具挑战性。

整个模型共有62亿个参数,其中语言理解和视觉理解各约15亿,视觉生成模块约24亿,其余分布在共享模块和外围组件中。视觉内容的生成采用了来自FLUX模型的冻结VAE作为图像的编码和解码工具,可以理解为一个专业的图像压缩与还原机器,负责在模型内部表示和最终输出图像之间架桥。

为了让模型在生成规划序列时既能保持因果逻辑(先发生的影响后发生的),又能让同一张图片内部的信息充分交流,RxBrain设计了一套混合注意力机制:处理文字时用因果注意力(只看之前的内容),处理图片时在每张图片内部用双向注意力(图片内所有位置互相参考),跨图片之间仍保持因果顺序。这就像一本故事书:同一页内的插图细节可以互相对照,但后面的页面不能“剧透”前面的内容。

三、RxBrain如何生成“文字+画面”交织的计划?

RxBrain支持三种输出模式,对应具身任务中的不同需求。

第一种是纯文字生成模式,用于回答关于当前场景的问题或输出语言形式的规划步骤。机器人“看”到眼前的场景后,通过标准的逐词生成方式输出文字答案或行动指令。

第二种是多帧视频预测模式,用于预测执行某个动作后,接下来四帧画面会是什么样子。这四帧画面是并行生成的(而非一帧一帧串行),大幅提升了效率,但帧间依然保持因果顺序——越后面的帧可以参考越早的帧,但不能“看到未来”。可以想象成同时制作四格漫画的四个格子,每个格子的画师都能看到前面格子已经画好的内容,但不能偷看后面格子。

第三种是交错生成模式,这也是RxBrain最核心的能力所在。在这种模式下,模型输出的是一个语言与图像交替出现的完整规划序列:先生成第一步的文字描述,再生成对应的目标状态图像;然后把这张生成的图像重新“看”一遍作为上下文输入,再生成第二步的文字,再生成第二步的画面……如此循环,直到任务完成。

关键的设计细节在于:在训练时,模型看到的“上一步生成的图像”不是直接拿来的原图,而是经过了“生成→解码→重新编码”这一完整流程处理过的图像。这么做是为了让训练时和真正推理时的体验尽量一致——因为在实际使用时,上一步的图像确实是模型自己生成的,而不是来自真实世界的照片。这个细节减少了训练和推理之间的“期望差距”,让交错生成的质量更加稳定。

四、用五万小时视频训练出“计划感”

要让RxBrain学会这种语言加视觉的联合规划能力,需要大量带有“每一步动作配对对应状态变化画面”的训练数据。然而,现有的数据集几乎没有这种格式——大多数机器人数据只有动作指令,或只有连续视频,没有把两者精确对齐起来。

为此,研究团队设计了一套全自动的数据构建流水线,把原始具身任务视频转化为“文字+画面”配对的联合规划训练样本。原始视频数据来自四大类来源:真实机器人操作数据、UMI手持夹持器采集数据、仿真环境数据、以及第一人称人类日常操作视频。总计超过5万小时,包含约2150万个可用片段,通过约2861万个候选片段筛选而来,通过率约75%。

这条流水线分三个阶段。第一阶段是时序片段标注:系统先对视频进行关键帧采样——不是均匀采样,而是优先选取画面变化最明显的时刻,就像一本菜谱只需要在每道工序最关键的时刻拍一张照片,而不是每秒都拍。采样完成后,用一个多模态大语言模型对视频进行整体理解,提出候选动作步骤列表,每个步骤包含一个简短名称、详细描述,以及在关键帧序列中对应的粗略起止位置。随后系统在粗略范围附近密集采样,用模型精确定位每个步骤的真实开始帧和结束帧。

第二阶段是质量验证:对每一个标注出来的片段,系统自动检查它是否符合高质量训练样本的标准。检查项涵盖三大类:语义质量、视觉接地性、以及一致性。如果画面变化有效但文字描述有误,系统会自动修正文字而不是直接丢弃这个片段。最终,约75%的候选片段通过了质量验证。

第三阶段是片段结构化:把通过质量验证的片段组织成四个层级的训练任务。最基础的L0层是单步预测,输入一步的起始画面和动作描述,预测这步结束时的画面;L1层是步骤级联合规划,给定视觉上下文和目标条件,模型输出一系列步骤文字及其对应的结束画面;L2层是子目标规划,把若干步骤合并为更高层次的子目标,每个子目标配有边界画面;L3层是最终状态想象,只给初始画面和任务描述,让模型直接预测整个任务完成时的最终画面。这四个层级从局部到全局,让模型学会在不同粒度上进行联合规划。

五、分两阶段训练:先打基础,再专攻具身

RxBrain的训练采用两阶段课程式策略,可以类比为先上通识课、再上专业课。

第一阶段是联合视觉语言预训练,训练数据由两大部分混合而成:60%是大规模图文对,40%是多模态指令跟随数据。这一阶段的核心目标是让模型同时学会理解图像和生成图像,在一个共享的表示空间中把语言、视觉感知和视觉生成统一起来,同时保留大语言模型原有的语言能力。图像生成目标损失权重设置相对更高,语言生成权重相对较低,这是因为视觉生成能力需要从头建立,而语言能力已有良好基础。

第二阶段是具身监督微调,从第一阶段的检查点继续训练,训练数据混合了六类内容,包括一般图文对、通用多模态理解数据、具身多帧世界模型数据、以及具身交错规划数据。这一阶段两类损失权重相等,让语言推理和视觉生成在具身任务上协同提升。

训练时使用了最高368块GPU,全局批量大小7360;第二阶段使用312块GPU,全局批量3120。两阶段均使用AdamW优化器、余弦学习率调度和bf16精度,图像生成分辨率上限256像素,通过16倍下采样的VAE进行潜变量操作。

六、RxBrain-Bench:专门评测“联合规划”能力的新基准

为了衡量模型是否真正掌握了“语言+视觉联合规划”的能力,研究团队专门构建了一个新的评测基准:RxBrain-Bench

这个基准分三个评测赛道。第一个赛道叫具身视觉问答,评测模型能否从视觉观察中理解具身场景并作出任务相关的决策。题目来自工业、零售和服务等真实商业场景,涵盖高层规划、模拟推进规划、细粒度步骤推理、错误恢复、以及任务完成判断。共1123道多选题加258道模拟规划题,总计1381个评测项目。

第二个赛道叫世界状态预测,评测模型在给定当前观察和自然语言动作指令后,能否生成描述动作结果的短时序画面(4帧)。评测标准包含五个维度:观察连续性、动作正确性、目标完成度、时序物理合理性、以及与真实轨迹的匹配度,最终加权得分为这五项的线性组合。

第三个赛道叫联合规划,也是RxBrain-Bench最核心的部分,评测模型能否在完全自回归的闭环推演中进行语言加视觉的联合规划。模型在每一步都必须输出自然语言子步骤描述和对应的目标画面,然后以自己生成的画面作为下一步的输入继续规划,直到任务完成。评测标准包含六个维度:观察理解、子任务规划、目标图像正确性、子任务与目标的一致性、完整链条的完成度、以及图像相似度,加权得分覆盖这六个方面。

七、评测结果:在多个维度上表现出色

在通用图像生成能力方面,RxBrain在GenEval基准上获得82.4分,与专门针对图像生成优化的模型基本持平,明显高于同样具备生成能力的对比模型。这说明RxBrain在扩展到具身任务的同时,并没有牺牲其通用图像生成能力。

在具身与空间理解方面,RxBrain在多个公开基准上处于前列。在CV-Bench上以88.59分排名第一,在EmbSpatial上以82.3分紧追第二名,在DA-2k深度感知理解上以83.4分排名第一。特别在多视角和三维理解领域,RxBrain的优势最为突出:在3DRSBench上以54.1分排名第一,在MMSI-Bench多图空间智能上以35.8分领先,在MindCube空间心理建模上以47.5分名列前茅,在SITE-Bench图像空间理解上以54.9分居首。在机器人轨迹预测上,RxBrain以51.13分排名第一,比此前最佳模型高出约12个百分点。在RoboSpatial-Home配置理解上以86.28分排名第一。不过,在需要精确指点定位和机器人抓取位置预测方面,专门针对空间指向优化的模型仍然更强。

在RxBrain-Bench-EVQA的自建评测中,RxBrain综合得分为72.7分,低于其他两个对比模型,但在成功检测和模拟规划两个维度上表现最佳,说明模型在判断任务是否完成以及在多轮模拟中更新决策方面有独特优势。主要差距集中在精细空间定位、轨迹与时序推理以及错误恢复方面。

在世界状态预测评测中,RxBrain以0.62的综合得分超越其他对比模型。观察连续性得分0.67和动作正确性得分0.65是最强项,时序物理合理性0.53是最弱项,说明生成画面的物理连贯性仍有提升空间。在不同子数据集上的表现从0.73到0.35不等,两帧条件输入的整体效果最佳。值得关注的是,RxBrain虽然并非专门的视频生成模型,却超过了专为具身世界建模设计且在大量视频数据上预训练的模型,体现了统一模型架构的优势。

在联合规划评测中,RxBrain以0.68的综合得分大幅领先所有基线。具体来看,观察理解得分0.83和子任务规划得分0.78是最强项,目标图像正确性0.52是最弱项,再次印证了语言推理能力强于视觉想象能力的规律。在不同规划深度上,两步规划得分0.69,八步规划得分降至0.55,体现了长程推演中误差累积的挑战。RxBrain在子任务规划和链条完成度上的领先优势最大,说明它在保持整体计划一致性方面具有明显优势。

八、从“大脑”到“手臂”:扩展到真实机器人动作生成

RxBrain不只是一个能规划的“大脑”,研究团队还把它扩展成能控制机器人手臂实际运动的系统。

扩展的方式是在原有的MoT架构基础上新增一个动作专属分支,包含独立的注意力投影层、前馈网络和层归一化,但仍与语言、视觉和状态的全局注意力共享信息交流。这个动作分支的初始参数复制自视觉理解分支,相当于让它从理解画面的能力出发,重新学习如何把理解转化为动作。

一个特别设计的“门控专家融合”机制让动作分支能够借用视觉生成分支中已经学到的预测性和规划性知识。具体来说,动作模块的前馈网络输出等于动作专属前馈网络的结果加上一个可学习的通道门控权重乘以视觉生成前馈网络的结果。这个门控权重初始为零,意味着训练开始时动作模块完全依靠自身,随着训练推进,门控权重逐渐学习到哪些视觉生成知识对动作预测有帮助,并选择性地引入。这种设计让动作模块不需要从零开始学习规划性知识,而是站在视觉生成模块已有积累的肩膀上。

动作的表示方式是:对于双臂机器人,每个机械手臂的末端执行器状态包含三维位置、四元数姿态和夹持器开合量,共16维。本体感知状态通过轻量级编码器映射为单一状态令牌,未来H步的动作块通过流匹配在归一化动作空间中生成,训练目标是让模型预测的速度场在去噪过程中准确指向真实动作方向。

在真实机器人实验中,研究团队选取了三个多阶段家务操作任务进行评测,每个任务各进行100次真机试验。在“摆设餐桌”任务中,RxBrain成功率97%,超过对比模型。在“折叠收纳眼镜”任务中,RxBrain成功率95%,同样超过对比模型。在“捡拾垃圾”任务中,RxBrain成功率68%,略低于某个对比模型。三个任务的平均成功率为87%,而对比模型分别为68%和82%。需要特别指出的是,这些结果是在没有大规模动作数据预训练的情况下取得的,说明具身规划预训练产生的世界知识确实能够迁移到真实动作控制中。

九、让推理速度跟上机器人的手速

在实验室里表现优秀的模型,在真正控制机器人时还面临一个重要挑战:速度。如果模型每次预测动作都需要很长时间,机器人就会动得磕磕绊绊,就像一个总是犹豫半天才迈腿的人走路一样。

研究团队对实时部署进行了专项加速优化,并坚守一个底线:所有优化必须在数值上等价于原始模型,也就是说机器人的轨迹不能因为加速而发生任何可测量的变化。

原始模型每帧推理需要210毫秒,主要瓶颈出乎意料地不是矩阵乘法,而是混合变换器架构中的模态分发逻辑:每一层都要重新计算哪些令牌属于语言、哪些属于视觉、哪些属于动作,这个操作在一次前向传播中触发了约1091次nonzero调用,累计占据174毫秒CPU时间,再加上索引操作的48毫秒和拷贝操作的21毫秒。

针对这个瓶颈,研究团队实施了三项优化:预计算前缀键值缓存、仅对动作令牌进行快速解码、去同步化模态分发加CUDA图捕获。三项优化组合后,推理延迟从210毫秒降至143毫秒,提速约1.47倍,同时位置误差小于0.65毫米、姿态误差小于0.73度,完全处于bf16精度的舍入误差范围内。

研究的局限与未来方向

研究团队坦诚地指出了RxBrain目前存在的三个主要局限。第一,模型规模相对较小(62亿参数),可能限制了它处理高度复杂推理、精细视觉想象和长程规划的能力,扩大模型和数据规模是显然的改进方向。第二,虽然RxBrain能跨多种具身场景泛化,但对于完全陌生的环境、机器人形态或任务领域,仍然需要额外的微调才能达到理想性能。第三,交错生成涉及两种不同的生成范式,训练和推理之间仍然存在一些差异,尽管通过VAE重建传递的视觉状态构建策略已经有所缓解,但尚未引入强化学习或其他序列级优化方法来进一步对齐两种模态的生成过程。

未来团队计划向两个方向发力:一是扩大模型规模,预期更大的模型将在联合规划的连贯性、世界状态预测的准确性和整体规划能力上带来系统性提升;二是增强自主性,让模型更好地分解开放性任务、监控执行进度、修正规划并以更自主的方式与环境交互。

说到底,RxBrain这项工作的意义在于它清晰地回答了一个问题:一个能真正胜任复杂任务的机器人大脑,需要的不仅仅是会说“第一步做什么”,也需要能在脑海中“看见”每一步完成后世界应该是什么样子,这两种能力必须紧密耦合,而不是各自为政。RxBrain给出了一套初步但系统的实现方案——从模型架构、数据构建、训练策略到评测体系——为具身认知基础模型的研究开辟了一条有价值的路径。

本文转载于:https://www.163.com/dy/article/L2V6VTF10511DTVV.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注