商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 智元大模型登上DailyOmni全模态理解榜单首位

智元大模型登上DailyOmni全模态理解榜单首位

  发布于2026-07-29 阅读(0)

扫一扫,手机访问

7月28日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview,凭借音视频联合理解与时序推理能力,以85.21分综合成绩登顶榜首,在八项细分指标中拿下了六项第一。这一成绩,让不少业内人士看到了人机交互从“僵硬”到“自然”的实质性突破。

智元大模型登上DailyOmni全模态理解榜单首位

对人形机器人来说,交互能力一直是块难啃的骨头。传统全模态模型大多优先适配线上数字内容——比如语音助手、视频理解这类场景,但机器人面对的是持续变化的物理空间。它不仅要同步“看见画面、听见声音”,还得实时判断声音是谁发出的、事件发生的先后顺序,甚至要识别交互对象、找准回应的时机。这些任务涉及时序耦合的复杂推理,传统模块化机器人方案很难完成,也是长期以来人机交互生硬割裂的关键瓶颈。

放在具身智能机器人身上,理解和回应从来不是两个割裂的步骤,而是一个持续发生的物理过程。机器人要一边观察环境、一边接收声音;一边组织语言、一边配合动作和表情。在多人、开放且持续变化的真实环境中,它还必须进一步判断:是否应该回应、什么时候回应,以及正在与谁交互。这已经不是简单的“语音+视觉”拼凑能解决的问题。

据智元方面介绍,WITA-Omni并没有简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。换句话说,机器人不再需要多个模块各管各的,而是用同一个大脑去统筹所有交互行为。

这背后是一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在预训练阶段,WITA-Omni使用了千万小时级的多模态数据,将原本强文本、视觉的底座进一步升级,让它能够“听得见、看得懂,并进行音画联合推理”。模型不仅学会了“回答正确”,还进一步在真实场景中判断:该不该回应、何时回应,以及回应谁。这才是真正走向实用化的关键一步。

本文转载于:https://www.163.com/dy/article/L2UNRJS8053469RG.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注