商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 英伟达推出全球首款全开源全模态物理AI大模型Cosmos 3

英伟达推出全球首款全开源全模态物理AI大模型Cosmos 3

  发布于2026-06-01 阅读(0)

扫一扫,手机访问

6月1日,英伟达正式发布了Cosmos 3——一个面向物理人工智能的开放世界基础大模型。这个模型基于混合Transformer架构,把视觉推理、世界生成和动作预测整合到了同一个系统里。


英伟达给它的定位是全球首款全开源的全模态大模型,能原生理解并生成文本、图像、视频、环境音效和动作内容。物理仿真的精度在业界处于领先水平。更重要的是,它能把物理人工智能的训练和评估周期从几个月缩短到几天——这一点对研发效率的提升相当可观。

与此同时,英伟达还发起了一个名为“英伟达宇宙联盟”(NVIDIA Cosmos Coalition)的组织,聚集了全球顶尖的世界模型研发团队和AI开发者,成员包括Agile Robots、Black Forest Labs、Generalist、LTX、Runway以及Skild AI。目标很明确:共同推动下一代世界模型技术的发展。

英伟达创始人兼CEO黄仁勋在发布时提到:“多模态推理语言、视觉与世界模型接连取得突破,物理人工智能的变革时代即将到来。Cosmos 3系列开源前沿全模态模型,将助力开发者实现技术跨越,打造能在现实世界中感知、推理、规划并执行动作的机器人、自动驾驶汽车及视觉人工智能系统。”

物理人工智能一直以来有个硬骨头:如何让机器人、自动驾驶车辆和视觉智能体,在有限训练数据和零散仿真框架下,能在真实场景里具备泛化能力。Cosmos 3给出的方案,正是针对这个核心难题。

模型采用混合Transformer架构,把推理Transformer和专精生成类Transformer结合在一起。具体来说,它会先解析物体之间的交互、运动规律以及时空关联关系,然后再完成视频生成和动作轨迹预测。逻辑链条非常清晰。

训练数据方面,Cosmos 3基于海量多模态物理人工智能数据集——涵盖数十亿条文本、图像、视频、音效及动作轨迹样本。开发者拿这个预训练基础模型去搭建自己的物理AI系统,所需的数据量和成本都能大幅降低。

开发者可以把Cosmos 3当作三类工具来用:

1. 多模态图文大模型,实现跨模态的理解与推理;
2. 世界模型/视频基础模型,用来仿真物理环境、预判场景未来状态,支撑模型训练与评估;
3. 世界动作模型主干网络,辅助训练机器人完成各类专项任务。

从评测数据来看,Cosmos 3在物理AI主流基准上的表现相当抢眼。在开源模型范围内,它的世界生成精度在Artificial Analysis、Physics-IQ、PAI-Bench和R-Bench中排名第一;动作策略能力领跑RoboLab和RoboArena基准;视觉理解能力则位居VANTAGE-Bench和TAR榜单榜首。几项关键指标都拿到了头名,含金量不低。

英伟达还提供了多个版本,适配物理AI不同的研发阶段:

Cosmos 3 Super:面向机器人和自动驾驶模型的二次训练,追求极致的物理精度与生成效果;
Cosmos 3 Nano:能在数秒内完成高品质视频解析与动作推理;
Cosmos 3 Edge:即将上线,主打边缘端实时推理。

目前Cosmos 3 Super和Nano已经正式推出,Edge版也即将到来,边缘端实时推理这个方向值得持续关注。

本文转载于:https://www.163.com/dy/article/KUBHHF4G0511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注