您的位置:首页 >摩尔线程公布万卡级集群训练成绩 称国产芯片可训出前沿模型
发布于2026-07-30 阅读(0)
扫一扫,手机访问
2026年世界人工智能大会(WAIC)上,摩尔线程带来了一连串重磅消息,直指国产算力产业链的核心进展。先说几个关键信息:一款236B参数的MoE模型,基于国产万卡级集群完成训练;一款具身智能大脑模型,则由国产千卡集群支撑;此外,北京大学EvoPhys团队的首个全球5D世界模型EvoPhys-World,整个全栈原生训练过程,都依托于MUSA软件栈来提供底层支撑。
具体来看,MoE-236B模型基于超过25T的语料,在摩尔线程的万卡级集群上从零开始预训练到长窗口训练,整个过程一气呵成,有效训练时长占比超过了90%。
摩尔线程高级副总裁董龙飞特别强调了“高精度”这个概念。这里的“高精度”,指的并不是单次计算的数值精度,而是模型在不同GPU平台间迁移训练时的结果对齐能力——简单说,就是相同模型架构、训练数据、超参数下,能不能得到稳定、可比的训练结果。这才是关键所在。
摩尔线程给出的具体数据相当有说服力:在DeepSeek这类MoE模型上,与国际主流GPU做对比训练,前3万步的平均相对误差控制在万分之六以内。他们还用500B到5T不等规模的数据做了多轮实验,结论是:基于相同卡数、模型配置和训练流程,在摩尔线程平台训练出的模型,在后续的Benchmark评测中得分与参考平台基本一致,部分指标甚至更高。
另一个值得关注的案例,是摩尔线程与北京大学EvoPhys团队合作训练的5D世界模型EvoPhys-World。这款模型基于MTT S5000完成全栈原生训练,在WorldScore的“世界生成”维度上连续37天排名第一。该项目获得了摩尔线程“灯塔计划”的支持,这不仅是国内第一次由中国科学家在中国算力设备上完成的原创世界模型工作,更是“国芯训国模”这条路上一个真正的分水岭。
同时,北京智源研究院的RoboBrain 2.5具身大脑模型,也依托摩尔线程MTT S5000千卡智算集群,基于FlagOS-Robo框架,成功完成了全流程训练。这首次验证了国产算力集群在具身智能大模型训练中的高可用性与效率,意义不言而喻。
摩尔线程创始人张建中,则用了一个非常形象的比喻来描述AI产业布局——按功能拆分为三类“工厂”:模型训练工厂、词元生产工厂、智能体生产工厂。这三者共用同一套全功能GPU架构,这也是摩尔线程与走专用芯片路线(ASIC)的厂商之间,最核心的分野所在。
在词元生产工厂方向,摩尔线程重点展示了基于MTT S5000的PD分离异构推理方案。具体来说,就是把算力需求大的Prefill(预填充)计算放在S5000上,而把带宽需求高的Decode(生成)计算放在国际主流GPU上,两者异构分池部署。张建中在演讲中给出的数据很直观:异构组合后,整体吞吐量较原有方案提升了近2倍。他甚至给出了一个算式:“3台S5000+2台国际主流GPU≈9台国际主流GPU”。董龙飞补充说,这类异构方案的性能比任何同构方案都要高50%以上,其中很大一部分收益来自KV Cache的调度优化。在类似OpenClaw这样反复调用本机命令行工具的场景下,缓存命中率可达90%,相当于节省了90%的算力。
过去一年,国产大模型发布后到完成硬件适配的周期,已经从“数月”压缩到了“发布即适配”(Day 0适配)。部分大模型厂商现在会在模型规划部署阶段,就与摩尔线程同步“共研”,而不是等模型发布后才启动适配工作。这种变化,折射出整个产业链协作效率的显著提升。
在具身智能方面,早期的VLA/VLM类模型参数一般在5B到14B之间,主要部署在端侧。但当前的世界模型路线不再依赖语言输入,而是直接处理物理世界,参数跨度更大。要实现高质量具身控制,大致需要10亿参数级别的模型在端侧运行,同时配合千亿级(1000B)及以上模型在云端协同。摩尔线程正基于自有万卡级集群,持续进行万亿参数模型的训练验证,不过具体进展和时间表尚未公布。
最后,聊到算力供应这个话题,董龙飞的观点很明确:中国的算力建设是面向未来十到二十年的基础设施投入,短期供不应求属于正常现象。以铁路、高速公路这些基建来类比,中国GPU或算力企业,远未发展到“供过于求”的地步。这个判断,或许能给整个行业吃下一颗定心丸。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9