发布于2026-08-16 阅读(0)
扫一扫,手机访问
7月9日,蚂蚁灵波悄然放出一个重磅消息——LingBot-Video正式开源。这是全球首个基于混合专家(MoE)架构、专门面向具身智能设计的视频生成基础模型。跟那些为短视频或影视特效打造的生成模型不同,LingBot-Video的出发点很纯粹:让机器人的眼睛能看懂世界,并学会如何行动。为此,团队从头梳理了视频预训练范式,在推理效率、物理合理性、动作理解以及任务完成度上实现了系统性的跃升,等于给视频基础模型从“数字内容创作”转向“具身智能”铺好了一条全新的开源底座。
实测数据很能说明问题。在北京大学联合字节跳动发布的机器人操作视频基准RBench上,LingBot-Video总分达到0.620,而行业熟知的Wan2.6是0.607,Seedance 1.5 Pro是0.584,Cosmos3 Super是0.581。RBench这个榜单专门用来考察模型能否生成符合真实物理规律的机器人行为,说白了就是看模型“演”出来的动作像不像真机器人干活。LingBot-Video能在这一项上领先,意味着它在保持动作连贯性和任务完整性方面确实棋高一着。



训练环节也做了硬核升级。LingBot-Video引入了一套多维强化学习奖励系统,除了常规的美学评分、prompt跟随度、运动一致性这些指标,重点加了物理合理性和任务完成度两个维度的对齐约束。这样训练出来的模型,生成的视频内容更贴合真实世界运转规律,也更符合机器人在现实场景中执行任务的实际需求——不只是“看着像”,还要“做得对”。
据了解,LingBot-Video的应用场景覆盖了机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等多个方向。现在模型已经正式开源,感兴趣的团队可以直接拿去用、去改、去跑实验。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9