发布于2026-06-22 阅读(0)
扫一扫,手机访问
最近,AI工程化领域的一场重磅峰会上,一个演讲主题引发了行业热议。作业帮基础架构研发工程师张浩然在第十届A2M峰会上,以《AI时代资源效率困境和破局之道》为题,系统拆解了AI基础设施领域“规模越大、浪费越严重”的行业怪圈,并首次公开了作业帮自研的三套核心破局方案。对于一直在算力成本和效率之间挣扎的技术团队来说,这无疑是一次干货满满的实战分享。

演讲刚开场,张浩然就抛出了一个让在场数百名技术专家都心头一紧的数据:过去5年,AI训练算力每六个月翻一番,增速远超摩尔定律;但与此同时,行业智算中心的GPU平均利用率却长期低于30%。
“花了十倍的钱,买了十倍的卡,实际有效算力可能只涨了2到3倍。”他直言,这背后是规模扩张与效率停滞的双重叠加——投入越多硬件,浪费反而越严重,成本压力像个无底洞。再搭上全球数据中心电力消耗年均增速已达15%,是其他所有行业总增速四倍以上的宏观背景,结论很明确:单靠“堆硬件”的路已经走不通了。AI算力的下一个战场,是效率。
值得注意的是,作业帮的算力版图并不是教科书里那种理想化的单一超大集群。它是一张遍布全国、多云、多地域的异构网络——各地域GPU型号不统一,数量随业务和成本动态增减,多集群部署缺乏统一通信与调度,资源潮汐空转浪费……这些现实问题,才是真正的拦路虎。
面对这些挑战,作业帮基础架构团队经过多年迭代,形成了一套层层递进、相互配合的系统性解法,核心目标就一个:用更少的资源,跑更多的AI服务和任务。
第一,跨地域算力网络创新。作业帮自研了一套统一流量调度系统,核心理念是让调用方对变动零感知。部署层面,团队从容器化之初就搭建了多云容灾,超前实现了多集群部署、镜像分发等能力。而部署后的核心难点是通信问题——他们创新性地让流量调度器根据各地域健康度和配比自动分发。无专线的地区,集群间通过公网通信,并在协议层级加密;有专线的地区,则支持专线和公网切换,避免专线故障带来的资源缺口。这套系统让单地域资源即使剧烈波动,服务SLA依然稳定维持在99.99%以上。
第二,单集群内的碎片化治理。这是效率提升的最大贡献点。团队自研了GPU调度器、RS-Webhook和碎片整理任务三件套,从调度、回收、整理三个层面协同作战。调度策略上,整卡的模型不同服务优先堆叠,同服务尽量分散;显存模型则按显存维度极致堆叠。回收策略方面,废弃了K8s默认的Pod回收逻辑,改为计算“哪台机器缩容后能空出最多卡”。碎片化治理阶段,经资源逐层检查与预调度,确认不影响在线服务后,对回收的资源进行标记,根据高峰和非高峰策略,把散落的Pod迁走,尽可能空出整机资源。
第三,在离线混合部署。前两套方案打好基础后,团队将在线离线混部策略升级为“只要有空闲整机,立刻填充离线训练任务”的高效模式,彻底告别固定时间窗口的潮汐离线。当在线Pod预调度失败时,系统自动驱逐任务量最少的离线任务,确保在线SLA不受影响。
经过这一套系统性优化,作业帮的跨地域算力网络彻底打破了地域限制,业务扩容再也不受单云、单地域束缚。结果呢?GPU平均利用率长期维持在90%以上,可用算力增加了约20%——这些数字直接转化为实实在在的业务价值和成本节约。
“AI时代,规模只是入场券,效率才是生死线。”张浩然在演讲结尾的这句话,正是作业帮基础架构团队多年实战的凝练。作为一家深耕教育AI的科技公司,作业帮不仅在复杂异构、多云分散的真实生产环境中跑通了GPU利用率90%+的方案,更将这套工程化经验开放分享,为整个AI基础设施行业的降本提效探路。
据悉,A2M峰会作为国内最早聚焦AI工程化实践的技术盛会之一,本届北京站于2026年6月13日至14日在中关村国家自主创新示范区会议中心举办,吸引了数百名来自互联网、AI、制造业等领域的技术决策者、架构师与研发骨干出席。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9