商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 十万卡集群建成,但真正的考验刚开始

十万卡集群建成,但真正的考验刚开始

  发布于2026-08-04 阅读(0)

扫一扫,手机访问

过去几年,聊中国AI,无论怎么绕,都绕不开一个词:缺卡。投资人见面问缺不缺卡,创业者诉苦说算力不够,行业报告里也总少不了“算力瓶颈”这四个字。时间一长,“缺卡”几乎成了中国AI产业的一层底色,甚至像某种心照不宣的共识。

但最近,这个老话题开始有了新变化。国产十万卡级AI超集群曙光8000正式落成,并且接入了国家超算互联网,对外提供算力服务。前两年,行业还在讨论“万卡集群”意味着什么,现在规模直接加了一个零,从万到十万。十万卡,最容易被人看到的当然是“大”,但如果你只把它理解成“国产算力又上了一个台阶”,那其实还远远不够。真正值得琢磨的是,当算力供给开始从“有没有”转向“能不能稳定、低成本、规模化使用”时,整个行业要面对的问题,也跟着变了。

十万卡不是终点,它更像是中国AI基础设施进入下一阶段的一张入场券——一张决定能否继续留在牌桌上的入场券。


十万卡,不是万卡乘以十

先说一个现实问题:一万张卡扩大到十万张,并不只是算力简单叠加十倍,麻烦会跟着放大十倍,甚至更多。大规模计算系统最怕短板效应——网络延迟高一点,成千上万张卡就可能在数据同步上互相等待;存储吞吐跟不上,训练效率会被拖慢;散热、能耗、调度、软件栈,任何一环不稳,都会在十万卡这个量级上被放大到难以收拾。所以到了这个阶段,已经不能只看硬件堆了多少,真正考验的是系统工程能力。

这也是“超智融合”这个概念值得被拿出来专门讲的原因。过去,超算更多服务科学计算,智算更多服务AI训练,两类系统各有各的边界,各干各的活。但现在很多任务已经不再按这种边界来运行了。AI4S、科学智能体、工业仿真、新材料、创新药筛选,这些任务往往既需要高精度科学计算,也需要低精度AI训推,还要处理大量数据读写和复杂调度。简单说,未来的先进算力平台,不能只会干一种活,它得是“全能选手”。


曙光8000走的,正是一套原生一体化的超智融合路线。它要解决的不是“把超算和智算设备放在一起”这种物理堆叠问题,而是在同一套系统里,支撑不同精度、不同负载、不同任务协同运行。这种能力在发布会PPT上可能不是最抢眼的,但真正到了机房里,它决定的是这套系统能不能长期跑、稳定跑、以更低成本跑。十万卡的难点,从来不只是建起来,而是用起来。


一个关键,算力入网了

不过,这件事最值得琢磨的地方,还不只是十万卡本身的规模。如果一套十万卡集群只是放在某个园区里,服务少数几个项目,它当然也是一项了不起的工程成果,但和更多科研机构、企业、开发者之间,还有一段距离。曙光8000接入国家超算互联网之后,性质就彻底变了。它不再只是一个孤立的大系统,而是进入了统一调度、统一服务的算力网络,开始以算力服务的方式对外开放。


锁在机房里的算力是资产,接进网络里的算力,才更接近生产力。这句话听起来有点像口号,但确实点出了问题的本质。

这对很多用户来说非常现实。AI创业公司、科研团队、产业用户,很多时候不是没有题目,也不是没有需求,而是缺少一个稳定、可负担、能长期使用的算力入口。自己建机房太重,买设备周期太长,养运维团队成本太高,临时找资源又常常面临排队、适配和稳定性问题。算力接入国家超算互联网后,逻辑开始发生变化。用户不必都去自建自管,而是可以通过统一入口申请、调度和使用先进算力。它还不能简单等同于“像水电一样即开即用”,但方向已经非常清楚:从各建各用,走向联网调度、按需调用和普惠服务。

所以看十万卡,不能只看“建成”这两个字。更重要的,是它被接入了怎样的服务体系。


真本事,要看真实负载

AI基础设施领域有个常见问题:容易把“建得多大”当成“起了多大作用”。机器建得大、参数写得漂亮,当然重要,但用户最后看的不是这些。科研团队关心的是,蛋白质结构能不能算得更快,新材料筛选周期能不能缩短;企业关心的是,工业仿真的试错成本能不能降下来,大模型训练能不能少崩几次,迁移和适配成本能不能更低。

据公开信息,曙光8000十万卡核心节点已完成300余项超智融合应用优化,覆盖大模型、机器人、汽车、创新药、新材料、量子计算、天文气象等二十多个领域,其中超过70个应用实现了万卡规模扩展。这组数字真正有价值的地方,不在于领域列得多全,而在于它说明这套系统已经开始被真实任务检验,而不是只停留在纸面规划上。

大规模集群最怕的不是测试,而是长期运行。科学计算、AI训练、推理服务、工业仿真、数据密集型任务,每一种负载对网络、存储、调度、软件栈和稳定性的要求都不一样。能在这些场景中持续优化,十万卡才不只是一个规模数字,而是一套能被反复使用的生产工具。所谓“超智融合”最后能不能站住脚,也要看它能不能在这些真实任务里跑出来。


下半场,拼的是运行账

集群落成不等于交卷,最多算进入了下一轮考试。接下来要看的,是一笔更细的运行账:算力利用率高不高,调度效率怎么样,任务排队时间能不能缩短,应用迁移难不难,单位任务成本能不能降,生态适配能不能滚起来,用户能不能持续用、放心用、用得起。这些指标没有“十万卡”三个字那么有冲击力,但更接近AI基础设施的真实赛点。

过去几年,全球AI竞争更多围绕模型展开:谁的模型更聪明,谁的参数更大,谁的推理更强。接下来,算力供给本身会变得越来越重要。谁能用更低成本、更高稳定性、更开放的方式,长期提供大规模算力,谁就更有机会支撑AI从模型竞赛走向产业落地。

如果说万卡集群回答的是“能不能撑起大模型训练”,那么十万卡要回答的问题更难:能不能支撑AI进入科研、工业和公共服务的长期场景。曙光8000把这道题推到了台前。它的意义不只是中国又多了一套大机器,而是国产先进算力开始通过国家超算互联网,从系统工程能力走向公共服务能力。

十万卡之后,行业不会只为“建得更大”鼓掌。真正的问题会变成:好不好用,贵不贵,能不能长期稳定用上。


本文转载于:https://www.163.com/dy/article/L1O78J7K0535ORBB.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注