发布于2026-07-29 阅读(0)
扫一扫,手机访问
先说几个关键结论:在具身智能感知能力这条赛道上,又有一家中国公司跑到了前面。而且,这次拼的不是单纯的模型参数量,而是对真实世界音视频信息的“联合理解”能力——这恰恰是人形机器人走进真实场景的硬门槛。
最新的消息是,在业内公认的具身全模态理解权威榜单DailyOmni上,智元自研的具身原生全模态大模型WITA-Omni Preview,以85.21分的综合成绩登顶榜首。什么概念?这个分数超过了千问、Gemini、豆包、英伟达这些国内外头部玩家。在八项细分指标中,它拿下了六项第一。

这个DailyOmni榜单,和那些靠图文、短视频刷分的评测任务完全不同。它大量使用真实开放环境下的音视频素材,要考的就是模型能不能同时看懂画面、听懂环境音,并且精准识别出画面里谁在说话、声音和画面是不是匹配、事件发生的先后顺序。说白了,这就相当于人形机器人在物理世界里跟人互动时,必须具备的“耳朵”和“眼睛”协同工作的能力。

关键就在这里。WITA-Omni之所以能领先,并不是简单地把一个聊天模型“塞进”机器人里。它真正厉害的地方,是把物理动作和表情提升到了与语音输出同等的地位——也就是说,它用的是一个原生的端到端模型,统一驱动感知、决策和表达。从架构上看,它从传统的“思考者-对话者”范式,扩展出了面向具身输出的“思考者-对话者-行动者”架构。这才是真正的“原生”——不是事后拼凑,而是一体化设计。
当然,这种能力不是靠堆钱堆算力砸出来的。它背后是一套围绕具身全模态交互构建的分层数据体系和训练方法。在预训练阶段,WITA-Omni使用总计千万小时级的开源和自有多模态数据,把原本擅长文本和视觉的底座,升级成了能“听得见、看得懂、还能进行音画联合推理”的全模态模型。
更大的挑战在于,公开的音视频数据通常缺少真实交互中的轮次切换、响应时机、动作和表情信息。也就是说,你拿这些数据去训练一个端到端的具身交互模型,几乎是行不通的。为此,智元专门构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留了声音、画面、语言、动作和表情之间的天然时序关系。这才是你看到它能在榜单上“碾压”各路对手的真正底气。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9