商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 超越谷歌和英伟达,智元交互模型登顶全球榜首,千问、豆包跻身前五

超越谷歌和英伟达,智元交互模型登顶全球榜首,千问、豆包跻身前五

  发布于2026-07-29 阅读(0)

扫一扫,手机访问

7月28日,复旦大学研究团队发布的DailyOmni最新榜单,引发了不少关注。这份名为“每日全模态交互能力评测”的报告中,智元硅光动语大模型预览版(WITA-Omni Preview)以85.21分的综合成绩直接登顶,超越千问、谷歌双子座(Gemini)、豆包以及英伟达旗下模型。更亮眼的是,在八项细分指标中,它一口气拿下了六项第一。

这次的DailyOmni榜单,是业内公认检验大模型音视频时序对齐与跨模态联合推理能力的权威第三方测试。和传统的图文理解不同,它重点考察的是模型在真实开放环境下的“全模态感知”能力——简单说,就是机器人能不能在复杂的物理空间里,精准判断“谁在说话”、“事件发生的先后顺序”,并做出恰当的交互决策。

硅光动语这款大模型,是智元自研的具身原生全模态大模型,属于智元“一体三智”框架中的交互智能。针对传统机器人“听、看、说、动”思维割裂、交互生硬的痛点,它独创了“思考—表达—行动”(Thinker-Talker-Actor)三层端到端架构。在这一架构下,机器人依靠视觉来理解物理世界,不再额外需要语音或文字指令,实现了感知、决策与表达的统一驱动。


“思考—表达—行动”三层端到端架构。

“这不仅要求模型‘听得懂’,更要求它‘会看眼色’,”智元技术专家表示。通过千万小时级的多模态数据基座,以及“监督微调—同策略蒸馏—强化学习”三阶段特训,硅光动语大模型不仅具备了音画联合推理能力,还学会了在多人复杂场景中判断“该不该回应、何时回应、回应谁”。

技术专家进一步解释,训练过程就像同时模拟“老师”和“学生”的角色。具体做法是,先训练一个“老师”模型,让它获得额外信息后生成高质量答案,然后将这种能力复制给没有额外信息的“学生”模型。同时,再配备一套“奖惩机制”,确保大模型生成内容时能保持表达风格统一,并大幅提升复杂音视频上下文中的推理能力。

值得关注的是,在这份榜单的前五名中,除了智元,千问、豆包等多款国产大模型也跻身前列。这充分彰显了中国人工智能在全模态感知领域的技术优势。


三款国产模型占据榜单前五。

今年5月,硅光动语大模型通过备案,成为全国首款合规备案的具身智能交互大模型,正式进入合规商用阶段。据了解,硅光动语大模型未来将与负责物理操作的“视觉—语言—动作”模型,以及提供虚拟训练环境的世界模型GE-Sim 2.0深度协同,加速人形机器人在商业服务、公共导览等场景的规模化落地。

本文转载于:https://www.163.com/dy/article/L301OVBA055040N3.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注