发布于2026-07-29 阅读(0)
扫一扫,手机访问

智元自研的具身原生全模态大模型WITA-Omni Preview登顶DailyOmni榜单。
先来看一个关键信息。国际权威的具身全模态理解评测榜单DailyOmni,最近放出了最新的测评结果。智元自主研发的具身原生全模态大模型WITA-Omni Preview,凭借在音视频联合理解与时序推理上的硬实力,以85.21分的综合成绩拿下了榜首位置。这个分数,直接超过了千问、Gemini、豆包、英伟达这些国内外主流模型。而且,在榜单划分的八项细分能力中,它一举拿下了六项第一。
这次登顶,分量不轻。它意味着智元在机器人面向真实物理世界的全模态理解与交互能力上,迈出了相当关键的一步。
简单介绍一下DailyOmni这个榜单。业内公认,它是评估音视频时序理解和跨模态推理能力的重要第三方测试。它跟那些侧重图文或短视频理解的评测不一样,大量使用了开放环境中的真实音视频素材。核心考察点在于:模型能否同时融合视觉画面和环境声音,准确识别出声音和画面的对应关系、事件发生的先后顺序,以及跨模态语义的综合理解能力。这些能力,恰恰是未来人形机器人在真实物理空间里,实现自然交互所必须掌握的核心技能。
差别在哪?对于人形机器人来说,自然的交互远比在线聊天要复杂得多。它不仅要能“看见”画面、“听见”声音,还得持续判断:这个声音是谁发出的?两个事件哪个先哪个后?现在正在跟谁交互?以及,什么时候该我回应了?
传统机器人通常是怎么做的?用多个独立的模块,分别负责感知、理解和控制。信息在这些模块之间一层层传递,不仅会造成时延,还很容易导致语言、动作、表情之间彼此割裂,看起来很不协调。这可以说是机器人交互体验长期以来难以突破的一个瓶颈。

WITA-Omni的创新之处,就在于它没有简单地把一个大语言模型“装进”机器人里。它的做法,是把物理动作和表情,提升到了和语音输出并列的一级地位。它用了一个原生端到端模型,统一驱动感知、决策和表达。从技术架构上看,它是在Thinker–Talker范式的基础上,进一步扩展出了面向具身输出的Thinker–Talker–Actor架构。
这样一来,对于机器人而言,“理解”和“回应”就不再是两个割裂的步骤,而是变成了一个持续发生、实时联动的整体过程。看、听、说、动,这四个维度第一次真正融合在了同一条时间轴上。
WITA-Omni的领先,并不是单纯靠堆模型参数规模堆出来的。它的背后,是一套面向具身交互而构建的大规模数据体系,以及针对性的训练策略。
在模型训练阶段,WITA-Omni基于千万小时级别的多模态数据进行训练,把原本强大的文本和视觉底座,进一步升级为能够“听得见、看得懂,并且能进行音画联合推理”的全模态模型。
这里还有一个关键问题。公开的音视频数据,通常缺少真实交互中至关重要的信息,比如轮次切换、响应的时机、动作和表情。直接用这些数据去训练端到端的具身交互模型,效果很难保证。所以,智元专门构建了一个以人为中心、面向真实交互场景的大规模高质量全模态数据集。这个数据集完整地保留了声音、画面、语言、动作和表情之间天然的时序关系。模型学到的,不仅仅是“给出一个正确答案”,更重要的是学会在真实场景中判断:该不该回应?什么时候回应?以及,回应谁?
这次在DailyOmni榜单上拿下全球第一,直接验证了WITA-Omni在物理世界视听时序理解任务上的独特竞争力。
作为具身智能行业里第一个机器人原生的端到端全模态交互大模型,WITA-Omni的价值并不仅仅在于支持了更多的模态。它的核心贡献在于,第一次把视觉、听觉、语言、动作、表情,统一到了同一个认知状态和同一条时间轴里。这让机器人能够实现持续感知、统一判断和同步表达。
相比传统那种模块化流水线式的交互方式,它推动机器人的交互模式,从“依次调用多个模块”,迈向“统一生成一个完整交互过程”。这种转变,让机器人真正具备了自然交流所必需的在场感、连续性和人格化表达能力。同时,也为具身智能在工业制造、商业服务、公共服务、文旅展演等场景的大规模落地,提供了一个全新的技术底座。
未来,依托WITA-Omni构建的交互智能底座,智元会进一步夯实“三智一体”的技术架构。它与作业智能、运动智能协同联动,持续驱动“本体-数据-模型-场景”这个四维一体的飞轮运转,去解锁更多商业场景、公共服务、影视展演等广阔的应用空间。面向未来,智元会持续迭代WITA硅光动语大模型,不断拉近具身智能与人类沟通的距离,加速具身智能新生产力时代的到来。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9