商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 蚂蚁灵波LingBot-VA 2.0发布 具身原生全栈技术布局取得关键进展

蚂蚁灵波LingBot-VA 2.0发布 具身原生全栈技术布局取得关键进展

  发布于2026-08-15 阅读(0)

扫一扫,手机访问

7月10日消息,蚂蚁灵波今天放了个大招——正式发布了业界首个具身原生世界动作模型,LingBot-VA 2.0。这一发布的意义,说白了,就是机器人基础模型开始从“数字世界模型构建”真正转向“面向物理世界原生设计”。这背后其实代表着一条关键的技术路线选择:机器人的“大脑”,不再是简单地“嫁接”数字世界模型的能力,而是从动态建模、因果预测、实时执行这些与环境交互的原始需求出发,进行原生设计。

因为采用了具身原生架构,LingBot-VA 2.0在真机测试中的表现相当惊艳——执行速度快,泛化能力强。举个例子,下面这段视频里,机器人完全不需要依赖任何外部拍摄设备,就能和人类完成多轮随机对打,动作流畅自然,一点也不拖泥带水。

今年以来,业界一直在反复讨论一个核心问题:世界模型和具身智能到底该怎么融合?答案是,从物理世界的“控制执行”需求出发,就必须持续具备符合因果规律的“预测能力”。机器人面对的是一个连续变化的真实世界,它不但要针对当前情况作出即时反应,还必须理解一个动作会引发怎样的环境变化,并据此决定下一步该怎么做。目前行业主流路线,大多是拿面向数字内容创作的视频生成模型,通过微调的方法来适配机器人控制任务。

但内容创作和机器人控制,出发点完全是两码事。内容创作在意的是画质和创意,机器人控制更看重执行效率和预测的合理性。这些差异导致数字世界的视频模型和物理世界的视频动作模型,从设计之初就各有各的能力侧重。强行“微调”把前者适配成后者,会带来知识遗忘、泛化性下降这些副作用,得不偿失。

LingBot-VA 2.0选择了直面问题,走一条更艰难的路——基于自回归架构从头开始预训练,通过四大核心设计来构建原生基模。

首先,模型引入了语义视觉-动作分词器作为全新的视觉编码器,在视觉压缩过程中加入了语义和动作信息的对齐,让模型在后续训练中更容易把“理解指令”转化为“完成动作”,这对指令跟随和动作精度提升都有帮助。其次,模型采用了严格的因果预训练范式,从训练一开始就使用自回归架构,确保视觉预测和动作生成完全遵循单向时间顺序。第三,引入MoE架构,在不牺牲推理效率的前提下有效扩大了模型容量,在性能和效率之间找到了一个不错的平衡点。最后,通过增强的异步推理机制实现实时闭环控制,机器人可以在执行动作的同时预测未来状态,并利用最新的真实观测不断校正下一步决策。基于这些设计,针对行业普遍面临的具身世界模型执行效率低的问题,LingBot-VA 2.0交出了单卡150Hz实时推理效率的成绩单。

从“干活”的角度来说,机器人需要“看得更清楚”、“想得更明白”、“干得更利索”。这周,蚂蚁灵波已经连续发布和开源了多款模型,包括面向空间感知的LingBot-Vision和LingBot-Depth 2.0、面向“一脑多机”的动作模型LingBot-VLA 2.0、面向实时交互的LingBot-World 2.0,以及面向更高推理效率的视频生成基模LingBot-Video。这些模型,代表着蚂蚁灵波在持续探索具身原生所需要的细分方向能力。而LingBot-VA 2.0作为集大成者扮演了收官之作的角色,也正式开启了具身原生的新阶段。

蚂蚁灵波CEO朱兴表示,一方面会持续探索具身智能的新上限,另一方面也会加速构建开放的技术生态和场景生态,助力机器人加速走进产业场景。

据了解,蚂蚁灵波将在7月17日至20日举行的2026世界人工智能大会期间,全面展示全栈大脑2.0落地场景的能力。

本文转载于:https://www.techweb.com.cn/internet/2026-07-10/2977304.shtml 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注