阿里Qwen-Robot 系列发布 让机器人会想会走会动手
就在6月17日,Qwen团队正式推出了一套机器人套件,包含三个基础模型:Qwen-RobotNa v、Qwen-RobotManip和Qwen-RobotWorld。这套模型的核心思路,是把大语言模型的语义理解能力,精准对接到不同类型的物理动作上——换句话说,让“语言”能直接指挥“机器”干实事。 先
就在6月17日,Qwen团队正式推出了一套机器人套件,包含三个基础模型:Qwen-RobotNa v、Qwen-RobotManip和Qwen-RobotWorld。这套模型的核心思路,是把大语言模型的语义理解能力,精准对接到不同类型的物理动作上——换句话说,让“语言”能直接指挥“机器”干实事。

先说Qwen-RobotNa v。它通过可控观测编码和工具接口,将视觉语言能力融入了移动控制。这意味着什么?它统一了四类典型的移动任务:指令跟随、点/目标导航、目标追踪,甚至自动驾驶。从“走到桌子旁边”这种简单的指令,到复杂的环境自主导航,一个模型框架都能搞定,这种整合在以往并不多见。
接着看Qwen-RobotManip,它专注于操作控制。其做法是规范状态-动作空间,并引入相机坐标系下的末端执行器增量位姿,从而让视觉语言能力更精准地驱动机械臂。更关键的是,它的训练语料库完全基于开源数据构建,规模超过了38,100小时,支撑起大规模的多机型训练——也就是说,同一个模型可以适配不同型号的机械臂,而不是为每个机型单独训练。
Qwen-RobotWorld则走的是另一条路:它通过自然语言动作接口,把视觉语言能力接入世界动态预测。说白了,就是让同一个世界模型能够跨操作、驾驶和导航场景,预测出符合物理规律的未来状态。这意味着,机器人不仅能看到现在,还能“想象”下一步会发生什么,这在复杂环境中的决策非常关键。
三个模型有一个共同点:都采用语言优先的接口。它们可以与通用大模型组合,构成完整的物理智能体系统。Qwen已经展示了从语言理解到复杂物理任务执行的闭环能力,包括实时任务分解和自主纠错——听起来像是,你只需告诉它“我想做这个”,它就能自己分解步骤、执行、发现问题并主动调整。这才是真正意义上的“可指挥机器人”。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















