商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > Meta定制版AMD MI450芯片算力减半、内存大缩水,SemiAnalysis:这是Meta公司文化的悲哀

Meta定制版AMD MI450芯片算力减半、内存大缩水,SemiAnalysis:这是Meta公司文化的悲哀

  发布于2026-07-25 阅读(0)

扫一扫,手机访问

说起来,Meta在AI基础设施这块儿,最近几脚踩得实在有点疼。这可不是小打小闹,而是动辄几十亿美元的代价,背后暴露出的,是其组织文化里那股子拧巴劲儿。

芯片行业研究机构SemiAnalysis最近就爆了个大料:Meta正在让AMD给它定制一款“缩水版”的MI450X芯片。算力单元砍了一半,HBM内存堆叠从12层缩到8层,内存容量直接少了近三分之二。这操作,SemiAnalysis直接定性为“灾难性”。更绝的是,他们还公开喊话AMD,说别跟Meta的基础设施团队扯皮了,直接去找Meta旗下的大模型研究团队TBD Lab,给他们推标准版MI450X。

01

AMD最强芯片遭“阉割”,GenAI性能严重受损

先说说AMD这款MI450X。它可是目前市场上硅工程规格最激进的GPU之一:2纳米制程、混合键合封装、12层HBM4内存,再加上最大的CoWoS光罩尺寸,基本代表了当前封装和存储密度的天花板。听起来就很猛,对吧?

但Meta到手的,却是一个定制版——计算硅面积直接减半,HBM堆叠也从12层砍到8层。算力、内存带宽,两项核心指标都受重创。Meta基础设施团队给出的理由是:这玩意儿是给推荐系统(RecSys)用的,需要提升CPU和GPU的比例。

问题在于,这个决定是在TBD Lab成立之前做的。TBD Lab作为Meta的核心大模型研究团队,对这款“阉割版”芯片毫无兴趣。SemiAnalysis说得更直白:跟英伟达的Vera Rubin比,这缩水版MI450对TBD Lab来说毫无吸引力,“TBD大幅倾向于Rubin”。这么一来,AMD在Meta的出货量,怕是要被这个决策结结实实地坑一把。

SemiAnalysis甚至罕见地直接向AMD喊话:“AMD得站出来,直接跟TBD团队合作,确保他们拿到正常版MI450,而不是这个对GenAI毫无价值的阉割版。”

02

Rivos收购:逾25亿美元换来一地鸡毛

Meta基础设施决策失误的另一个典型,是2024年那起超过25亿美元的Rivos收购案。据SemiAnalysis透露,Meta内部芯片部门,当时真正理解这笔收购战略逻辑的人寥寥无几。当初推动交易的人,事后也基本沉默了。主流看法是:Meta钱多,定制芯片赛道又热,加上之前已经授权了Rivos的知识产权,管理层觉得不如直接买下来完事。

但这交易结构本身就有问题。Rivos创始团队坚持全员打包出售,Meta只能把整家公司买下来,然后转头就把不需要的部门裁了个干净。报道援引前Meta芯片员工的话称,收购由Meta硅片负责人Yee Jiun Song主导,过程中内部反对声不小,但交易完成后,他本人的兴趣也淡了。现有芯片团队的管理者,把Rivos工程师当“免费劳动力”,各自拉到自己麾下,原来的团队架构迅速瓦解。

从技术层面看,收购的核心价值——Rivos的SIMT架构GPU IP——已经随着原计划搭载该技术的“Olympus”芯片项目被取消而烟消云散。接替方案“Phoebe”项目,预计最早2028年流片,但SemiAnalysis指出,内部对其能否落地,并不乐观。

人员流失更是触目惊心。据SemiAnalysis,约30%的Rivos员工在近期裁员中离职,联合创始人Mark Hayter已经离开,还有多名前Rivos人员在首批RSU于今年5月归属后,转投了Gerard Williams创立的芯片初创公司Nuvacore。SemiAnalysis还透露,Rivos首席执行官兼联合创始人Puneet Kumar,可能在其Meta股份全部归属后一两年内离职。

03

Grand Teton与Ariel:重复上演的设计代价

Meta的这种定制化偏执,不是一天两天了。它的H100定制服务器Grand Teton,在标准HGX服务器基础上,额外加了一个交换机托盘,搭载四颗博通PCIe交换机、16块SSD和八块网卡,目的就是给每台服务器提供更多直连存储,用于训练检查点保存。

结果呢?实际投入生产后,模型团队对这些存储的使用远远低于预期,该设计最终被放弃。SemiAnalysis指出,这是Meta硬件与软件团队缺乏协同设计的典型体现——基础设施团队为几乎没用的功能,付出了更高的物料成本和功耗代价,还增加了对博通的依赖。而Meta原本的初衷,正是要降低对英伟达网络设备的依赖——这操作,多少有点自相矛盾。

到了Blackwell时代,Meta的定制方案“Ariel”延续了类似逻辑。标准GB200规格是每颗Grace CPU配两颗B200 GPU,Ariel把它改成一对一,GPU数量直接减半。理由还是那个:为RecSys工作负载提升CPU比例。市场反馈却是,这个步子迈得有点大。

据SemiAnalysis测算,Ariel NVL36x2方案的总体拥有成本(TCO),比标准GB200 NVL72高出14%。多花这么多钱,换来的更多CPU和DRAM资源,恰恰是大模型团队不需要的。而且,因为GPU数量减少,组网出现缺口,不得不采用跨机架连接方案,网络延迟和可靠性问题随之而来。与此同时,最初被认为不稳定的NVL72背板,反倒逐渐成熟。Meta对这项技术风险的判断,事后证明有误。

一个更直接的信号是:SemiAnalysis表示,Meta的GB300服务器已经回归标准配置——这本身,就是对Ariel方案的最好否定。

04

文化根源:短期考核压倒长期战略

这么多问题,根子到底在哪儿?SemiAnalysis将其归因于Meta基础设施团队的组织文化。具体来说,Meta的六个月绩效考核周期,每轮都要淘汰最末10%到15%的员工。这种机制,导致团队自然倾向于追求短期可见成果,而不是长期技术布局。

一些管理者热衷于推动高曝光度但快速可交付的项目,交付后迅速转向,这种做法在内部被称为“粉刷门面”(window washing)。与此同时,鲜少有人公开挑战上级决策,错误也就难以被及时纠正。

供应链团队在工程决策中话语权有限,进一步放大了这些问题。SemiAnalysis指出,部分供应商已经因为Meta频繁的方向变动,降低了对新项目的优先级,转而优先保障亚马逊或谷歌的需求。

这一现象,跟Meta旗下Reality Labs的扩张历程何其相似——在大规模裁员到来之前,数十亿美元被投入庞大的工程团队和研发项目之中。如今,随着Meta开始向外部客户出售算力,这种内部文化的代价,将更加直接地暴露在市场面前。

本文转载于:https://36kr.com/p/3907399547262337 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注