商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 智元自研的具身原生全模态大模型登顶DailyOmni全模态理解榜单

智元自研的具身原生全模态大模型登顶DailyOmni全模态理解榜单

  发布于2026-07-28 阅读(0)

扫一扫,手机访问

这几天,具身全模态理解领域权威榜单DailyOmni的最新评测结果,引发了不少关注。智元自研的具身原生全模态大模型WITA-Omni Preview,以85.21分的综合成绩拿下了榜首位置,超过了千问、Gemini、豆包、英伟达这些国内外一线模型。更值得一提的是,在全部八项细分指标中,它拿下了六项第一。


DailyOmni这个榜单不是随便什么模型都能上的。它专门考察音视频的时序对齐和跨模态联合推理能力,测试素材大量来自真实开放环境,远不是那些用图文、短视频就能应付的常规评测。模型得同时处理视觉画面和环境音频,精准识别声画对应关系、事件先后顺序,以及跨模态语义的综合理解——这恰恰是人形机器人在真实物理空间进行人机交互所需的核心能力。

WITA-Omni Preview作为具身智能行业内首个机器人原生端到端多模态交互大模型,能在DailyOmni上超越一众主流Omni模型,说明它在物理世界视听时序理解方面,确实有独到的竞争力。

何以自然:WITA-Omni独创三层架构,让互动浑然一体

长期以来,人形机器人的交互能力一直有个瓶颈。以往的全模态模型大多优先适配线上数字内容,但机器人身处的是持续变化的物理空间。它不仅要“看见画面、听见声音”,还得实时判断谁在说话、事情发生的先后顺序,识别交互对象、找准回应时机。传统的模块化机器人方案,在面对这种需要时序耦合的复杂推理任务时,往往力不从心,这也是人机交互总显得生硬和割裂的根本原因。


对具身智能机器人来说,“理解”和“回应”从来就不是两个割裂的步骤,而是一个持续发生的物理过程。机器人需要一边观察环境、一边接收声音;一边组织语言、一边配合动作和表情。在多人、开放且不断变化的真实场景中,它更得判断:该不该回应?什么时候回应?正在跟谁交互?

WITA-Omni能领先的关键,不在于它把聊天模型简单“装进”机器人,而是把物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型来统一驱动感知、决策与表达。它在Thinker–Talker范式的基础上,进一步扩展出了面向具身输出的Thinker–Talker–Actor架构:

Thinker(思考)是多模态推理的核心,把文本、图像、音频、音视频经过各自的编码器和轻量投影层,映射到统一的表示空间,做跨模态联合推理和高层交互决策;

Talker(说)以Thinker的隐状态为条件,流式生成自然语音;

Actor(动)由动作头和表情头组成,把机器人动作与表情生成为与语音并列的一级输出——这是WITA-Omni面向具身场景的关键扩展。

何以领先:大规模数据训练,叠加针对性训练策略

WITA-Omni的领先,不单纯靠模型规模,而是源自一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在预训练阶段,它使用了千万小时级的多模态数据,把原本强大的文本、视觉底座,进一步升级为能“听得见、看得懂,并进行音画联合推理”的全模态模型。

不过,公开的音视频数据大多缺少真实交互中的轮次切换、响应时机、动作和表情信息,很难直接用来训练端到端的具身交互模型。为此,智元专门构建了一个以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留了声音、画面、语言、动作和表情之间天然的时序关系。

在千小时级的高质量数据上,WITA-Omni采用了SFT–OPD–RL三阶段训练策略:

SFT监督微调用于建立基础的全模态理解、交互决策和多流生成能力。

OPD同策略蒸馏让同一个模型同时扮演“老师”和“学生”。老师模型在获得额外时间区间、目标对象等特权信息后生成高质量答案,再通过蒸馏把能力传递回不依赖特权信息的学生模型。这样既保持了模型自身的表达风格,又提升了音视频上下文中的推理能力。

RL强化学习重点优化Thinker的交互决策能力。奖励信号覆盖可验证答案、时间区间匹配、目标人物选择、等待或回应决策,以及主动触发准确率,并通过GRPO来优化模型策略。

经过这一系列训练,模型不仅学会了“回答正确”,更学会了在真实场景中判断:该不该回应、何时回应,以及回应谁。

何以致远:三智一体不断演进,开启具身智能新未来

智元表示,WITA-Omni的意义不只是让一个模型支持更多模态,而是让机器人在统一认知状态和统一时间轴上完成感知、决策与表达。它将具身交互从多个模块依次调用的工程流水线,推进为一个能够持续感知、统一判断并同步表达的生成过程:看与听不再割裂,语言与动作不再分离,理解与回应不再是两个独立步骤。让“看、听、说、动”成为一个连续过程,打通了视觉、听觉、语言、表情、肢体动作全模态协同,让机器人不再只是“会说话的工具”,进化为拥有在场感、人格感的硅基伙伴。这项能力,也是具身智能落地现实场景、创造生产力的关键所在。

依托WITA-Omni构筑的交互智能底座,智元将进一步夯实“三智一体”技术架构,与作业智能、运动智能协同联动,持续驱动“本体-数据-模型-场景”四维一体飞轮运转,解锁更多商业场景、公共服务、影视展演等广阔空间。面向未来,智元将持续迭代WITA硅光动语大模型,不断拉近具身智能与人类沟通的距离,加速具身智能新生产力时代的到来。

本文转载于:https://www.163.com/dy/article/L2UPSFJQ05506BEH.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注