发布于2026-08-21 阅读(0)
扫一扫,手机访问
先说说最近业内一个值得关注的大动作。在2026“众智”大模型开放智算生态协同高级别研讨会上,中国信通院正式发布了AISHPerf人工智能软硬件基准体系3.0版本。这次更新的核心,是两项直接面向AI Infra领域的评测基准——AISHPerf-智算运维智能体评测基准和AISHPerf-算子生成智能体评测基准。对于关注智算底层能力的人来说,这可不是一次小打小闹的更新。

AISHPerf本身是人工智能软硬件基准体系,而这次国内AI原生基础设施服务商无问芯穹和清华大学团队深度参与了两项评测基准的建设,是重点技术支持方。
这两项基准的定位相当清晰。前者,也就是智算运维智能体评测基准,是业内首个面向AI Infra运维场景的评测体系,核心目标很直接——看运维智能体在真实生产环境中到底能不能解决实际问题,而不是纸上谈兵。后者则跳出了“模型能不能生成一个能跑的GPU算子”这种基础套路,把评测重心直接锚定在“生成的算子能否在真实量化推理部署中替代现有算子”这个工程可部署性问题上。说白了,就是要看它能不能真落地、真顶用。两项基准从底层算力优化到上层集群运维,给智算产业的标准化升级和高质量发展搭了一个统一的能力参照框架。
在这两项基准中,AISHPerf-智算运维智能体评测基准尤其值得单独拎出来说一说。它的意义不仅仅是“又多了一个评测基准”,而是它让我国在智算集群运维智能体领域有了第一个权威评测体系。更关键的是,它率先把国产芯片集群运维场景纳入了评测体系,把过去这个领域的标准空白给补上了。
现在AI的发展已经从“堆算力、拼规模”的阶段,迈入了以“Token效能”为核心的新节奏。算力和电力投入早已是AI基础设施的基础配置,这没什么好说的。但问题在于,过去业内对运维智能体的评估,大多还停留在语言问答能力层面,更像是闭卷考试,考的是知识记忆和标准答案复述,完全看不出智能体在真实运维场景里能不能打。而这款评测基准,从一开始就锚定了真实生产场景,做的是“实战考核”。
在设计上,它早早融入了对国产化生态的考量,率先在同类评测中纳入了“天数、壁仞、沐曦、摩尔、昇腾”5款国产芯片集群运维的特定场景和典型问题测例。从国产GPU硬件故障、驱动适配、框架兼容,到通信协议这些典型的运维痛点,全都覆盖在内。可以说,它为国产智算运维智能体建立起了第一把统一、可量化的评估标尺,填补了国产智算运维领域的标准空白。
按照计划,中国信通院接下来会从标准研制、测试验证、生态培育几个维度持续推动这项基准的产业应用。一方面会不断增加国产芯片相关的评测用例,逐渐构建起体系化、全栈化的国产智算运维评测体系;另一方面,通过标准化评测去驱动运维智能化能力的升级,最终目标是把国产算力集群从“能用”真正推到“好用、高效、稳产”的水平,为整个智算产业的自主可控和高质量发展打好底层标准支撑。
放眼未来,中国信通院、无问芯穹和清华大学三方还会继续深化产学研协同,不断迭代AISHPerf-智算运维智能体评测基准,扩充场景覆盖维度、丰富数据集规模、提升评测结果的可靠性和权威性。最终目标,是让它成为行业公认的AI集群运维智能体能力评估公共基线,牵引全行业优质运维智能体的技术迭代和规模化落地。同时,各方也在同步拓展AI Infra全领域的核心评测基准布局,搭建全栈的标准矩阵,为构建高效、绿色、自治的新一代AI基础设施筑牢标准底座。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9