发布于2026-08-15 阅读(0)
扫一扫,手机访问
7月10日消息,蚂蚁灵波今天放了个大招——正式发布了业界首个具身原生世界动作模型,LingBot-VA 2.0。这一发布的意义,说白了,就是机器人基础模型开始从“数字世界模型构建”真正转向“面向物理世界原生设计”。这背后其实代表着一条关键的技术路线选择:机器人的“大脑”,不再是简单地“嫁接”数字世界模型的能力,而是从动态建模、因果预测、实时执行这些与环境交互的原始需求出发,进行原生设计。
因为采用了具身原生架构,LingBot-VA 2.0在真机测试中的表现相当惊艳——执行速度快,泛化能力强。举个例子,下面这段视频里,机器人完全不需要依赖任何外部拍摄设备,就能和人类完成多轮随机对打,动作流畅自然,一点也不拖泥带水。

今年以来,业界一直在反复讨论一个核心问题:世界模型和具身智能到底该怎么融合?答案是,从物理世界的“控制执行”需求出发,就必须持续具备符合因果规律的“预测能力”。机器人面对的是一个连续变化的真实世界,它不但要针对当前情况作出即时反应,还必须理解一个动作会引发怎样的环境变化,并据此决定下一步该怎么做。目前行业主流路线,大多是拿面向数字内容创作的视频生成模型,通过微调的方法来适配机器人控制任务。
但内容创作和机器人控制,出发点完全是两码事。内容创作在意的是画质和创意,机器人控制更看重执行效率和预测的合理性。这些差异导致数字世界的视频模型和物理世界的视频动作模型,从设计之初就各有各的能力侧重。强行“微调”把前者适配成后者,会带来知识遗忘、泛化性下降这些副作用,得不偿失。
LingBot-VA 2.0选择了直面问题,走一条更艰难的路——基于自回归架构从头开始预训练,通过四大核心设计来构建原生基模。
首先,模型引入了语义视觉-动作分词器作为全新的视觉编码器,在视觉压缩过程中加入了语义和动作信息的对齐,让模型在后续训练中更容易把“理解指令”转化为“完成动作”,这对指令跟随和动作精度提升都有帮助。其次,模型采用了严格的因果预训练范式,从训练一开始就使用自回归架构,确保视觉预测和动作生成完全遵循单向时间顺序。第三,引入MoE架构,在不牺牲推理效率的前提下有效扩大了模型容量,在性能和效率之间找到了一个不错的平衡点。最后,通过增强的异步推理机制实现实时闭环控制,机器人可以在执行动作的同时预测未来状态,并利用最新的真实观测不断校正下一步决策。基于这些设计,针对行业普遍面临的具身世界模型执行效率低的问题,LingBot-VA 2.0交出了单卡150Hz实时推理效率的成绩单。
从“干活”的角度来说,机器人需要“看得更清楚”、“想得更明白”、“干得更利索”。这周,蚂蚁灵波已经连续发布和开源了多款模型,包括面向空间感知的LingBot-Vision和LingBot-Depth 2.0、面向“一脑多机”的动作模型LingBot-VLA 2.0、面向实时交互的LingBot-World 2.0,以及面向更高推理效率的视频生成基模LingBot-Video。这些模型,代表着蚂蚁灵波在持续探索具身原生所需要的细分方向能力。而LingBot-VA 2.0作为集大成者扮演了收官之作的角色,也正式开启了具身原生的新阶段。
蚂蚁灵波CEO朱兴表示,一方面会持续探索具身智能的新上限,另一方面也会加速构建开放的技术生态和场景生态,助力机器人加速走进产业场景。
据了解,蚂蚁灵波将在7月17日至20日举行的2026世界人工智能大会期间,全面展示全栈大脑2.0落地场景的能力。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9