智元大模型登上DailyOmni全模态理解榜单首位
智元自研具身原生全模态大模型WITA-OmniPreview以85.21分登顶DailyOmni榜首,八项指标中六项第一。该模型具备音视频联合理解与时序推理能力,通过端到端架构统一驱动感知、决策与表达,将物理动作和表情提升为一级输出,突破人机交互时序耦合瓶颈。
7月28日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview,凭借音视频联合理解与时序推理能力,以85.21分综合成绩登顶榜首,在八项细分指标中拿下了六项第一。这一成绩,让不少业内人士看到了人机交互从“僵硬”到“自然”的实质性突破。

对人形机器人来说,交互能力一直是块难啃的骨头。传统全模态模型大多优先适配线上数字内容——比如语音助手、视频理解这类场景,但机器人面对的是持续变化的物理空间。它不仅要同步“看见画面、听见声音”,还得实时判断声音是谁发出的、事件发生的先后顺序,甚至要识别交互对象、找准回应的时机。这些任务涉及时序耦合的复杂推理,传统模块化机器人方案很难完成,也是长期以来人机交互生硬割裂的关键瓶颈。
放在具身智能机器人身上,理解和回应从来不是两个割裂的步骤,而是一个持续发生的物理过程。机器人要一边观察环境、一边接收声音;一边组织语言、一边配合动作和表情。在多人、开放且持续变化的真实环境中,它还必须进一步判断:是否应该回应、什么时候回应,以及正在与谁交互。这已经不是简单的“语音+视觉”拼凑能解决的问题。
据智元方面介绍,WITA-Omni并没有简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。换句话说,机器人不再需要多个模块各管各的,而是用同一个大脑去统筹所有交互行为。
这背后是一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。在预训练阶段,WITA-Omni使用了千万小时级的多模态数据,将原本强文本、视觉的底座进一步升级,让它能够“听得见、看得懂,并进行音画联合推理”。模型不仅学会了“回答正确”,还进一步在真实场景中判断:该不该回应、何时回应,以及回应谁。这才是真正走向实用化的关键一步。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















