商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 全国首款!智元具身交互模型通过合规备案,今年将推出升级版,可与人自然对话

全国首款!智元具身交互模型通过合规备案,今年将推出升级版,可与人自然对话

  发布于2026-05-26 阅读(0)

扫一扫,手机访问



中国具身智能产业,正迎来一个标志性的节点。5月18日,上海市生成式人工智能服务备案情况公布,智元公司的WITA(硅光动语大模型)赫然在列,成为全国首款完成合规备案的具身智能交互大模型。这不仅仅是一纸批文,更意味着整个行业从早期的“技术验证”阶段,开始加速驶入“合规商用”的广阔天地。

简单来说,WITA模型是智元为其机器人打造的“大脑”中,负责“交互智能”的那一部分。它率先搭载于灵犀X2机器人上,其核心能力在于“察言观色”——能够通过人类的面部表情和语音语调,精准判断对方的情感状态,并给予回应。更关键的是,它实现了毫秒级的交互反应,并且让机器人能够依靠视觉来理解物理世界,不再完全依赖语音或文字指令。举个例子,当你同时向它展示咖啡和牛奶,并问“睡不着该喝什么”时,它会迅速指向牛奶并给出正确答案。这种直观的交互,正是具身智能走向实用的关键一步。


智元WITA通过合规备案。

然而,技术的演进从来不是一蹴而就的。随着机器人商用场景的不断拓展,WITA模型现有架构的局限性也开始显现。智元机器人董事长邓泰华对此并不讳言,他指出了当前模型的“三段式”工作方式:先把语音转成文字,交给大模型处理,再把生成的文字转成语音输出。这个过程,就像传话游戏,说话者的语气、情绪等“言外之意”,很容易在文字转换中丢失掉。显然,这种并非为真实物理世界机器人量身定做的交互模式,还有很大的进化空间,尤其是在情感化语音、拟人表情和长期记忆等功能上,亟待增强。


智元机器人灵犀X2。 新华社记者 方喆 摄

从“传话”到“对话”:下一代模型的关键跃迁

那么,下一代交互模型应该是什么样子?智元给出的答案是“端到端”。据悉,公司计划在今年第三季度推出行业首个端到端具身多模态交互大模型——WITA Omni 1.0。

所谓“端到端”,其革命性在于跳过了中间的语音转文字、文字转语音环节。模型直接用人类说话时的完整信息(包括声音频谱、语调等)进行训练和回应。这样一来,机器人在对话中不仅能理解字面意思,更能保留对话中的情绪和语境,回话时懂得分寸,更像一个真正的人在交流。

技术路径的改变带来了体验的质变。由于跳过了转换环节,WITA Omni的反应时延被压缩到了500毫秒以内,这个速度已经接近真人聊天的节奏。更重要的是,它支持随时插话、打断和纠正,让整个交流过程的感受,几乎与人与人之间的对话无异。这才是具身智能走向深度人机协作必须跨越的门槛。

云端部署与本地化未来

关于模型的落地方式,邓泰华也给出了清晰的路线图。WITA模型及其升级版WITA Omni,都将以云服务的形式提供,基于全球云节点进行部署。可以将其理解为:WITA是面向广泛场景的基础云服务,而Omni则是满足更高阶交互需求的专业服务。

但这并非终点。一个更具想象力的方向是本地化运行。邓泰华透露,未来的具身交互智能将逐步迁移至机器人本体运行。这意味着,即便在断网的特殊环境下,机器人也能如人类一般进行自然对话,其自主性和可靠性将得到极大提升。从云端赋能到本地智能,这或许是机器人真正融入我们日常生活和工作场景的终极形态。

技术的每一次合规备案,都是产业成熟度的一块基石。从WITA的率先破冰,到Omni的蓝图已绘,中国具身智能的交互之路,正从“能听会说”走向“善解人意”。接下来的故事,值得我们共同期待。

本文转载于:https://www.163.com/dy/article/KT88TGED055040N3.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注