发布于2026-05-26 阅读(0)
扫一扫,手机访问
最近几年,AI技术的爆发式增长,彻底重塑了芯片行业的竞争格局。英伟达、AMD这些巨头,几乎把所有研发精力和产能,都投向了利润丰厚的AI低精度计算领域。但这场轰轰烈烈的“AI淘金热”,却意外地让另一个至关重要的领域陷入了尴尬——高精度科学计算。
一个明显的信号是,像美国桑迪亚国家实验室这样的顶级科研机构,已经开始因为买不到合适的高性能计算芯片,而不得不将目光投向以往不太被关注的初创公司。

桑迪亚国家实验室可不是普通的研究所,它是美国三大核武器研发与维护实验室之一。那里的液冷超级计算机,常年处理着地球上最复杂的模拟任务:从模拟高超音速核武器在大气层中的飞行轨迹,到推演一枚核弹头在另一枚附近引爆的极端场景。过去十几年,支撑这些“国之重器”运算的核心芯片,几乎全部来自英伟达和AMD。
然而,情况正在起变化。桑迪亚实验室高性能计算团队的负责人Steve Monk坦言,随着主流芯片公司越来越向AI倾斜,加上供应链持续紧张,实验室在获取满足高精度科学计算需求的芯片时,压力越来越大。这种从供应链到计算能力的双重挤压,甚至让团队对未来能否顺利完成关键任务产生了担忧。
问题的核心,在于一项名为“双精度浮点计算”(FP64)的技术指标。对于核物理模拟这类科学计算来说,芯片必须能在不损失精度的前提下,同时处理极大和极小的数值。多年来,英伟达和AMD确实一直在争夺这个领域的领导地位,并借此拿下了众多大学和政府实验室的超算合同。但现实是,当下火热的AI训练和推理,根本用不上这么高的精度。于是,芯片设计的天平,无可避免地发生了倾斜。
FP64堪称科学计算领域的“黄金标准”,它是维系现代飞机飞行、火箭升空、疫苗研发乃至核武器正常运作的数学基石,能够表达超过18.44万亿亿个唯一数值。相比之下,现代AI模型通常使用的FP8精度,只能表达256个唯一值,两者完全不在一个量级。
一个颇具讽刺意味的例子是英伟达最新发布的Rubin GPU。它在AI推理算力上实现了飞跃,速度达到50 petaFLOPS,是上一代Blackwell的2.5倍。但它的FP64峰值性能呢?大约只有33 teraFLOPS,甚至比四年前推出的H100还低了1 teraFLOPS。当然,英伟达推出了基于Ozaki方案的FP64软件仿真技术,声称能在CUDA库中实现高达200 teraFLOPS的矩阵性能,是硬件性能的4.4倍。但这个方案也引来了质疑。AMD的研究员Nicholas Malaya就指出,这种仿真方法在某些基准测试中或许还行,但在材料科学或燃烧模拟等真实的物理计算中,其可靠性存疑,并且存在IEEE合规性不足、内存消耗翻倍等问题。
芯片咨询公司More Than Moore的首席分析师Ian Cutress总结得很到位:英伟达即将推出的Rubin芯片,其双精度性能按某些指标衡量不升反降,这让整个高性能计算领域的许多科学家都捏了一把汗。
巨头们的战略转身,无意中为市场留出了一道缝隙。而像NextSilicon这样的新锐玩家,正试图从这道缝隙中崛起。这家2017年成立的以色列初创公司,经过八年研发,累计完成了约3.03亿美元的融资,估值一度达到15亿美元。
NextSilicon走的路子,和英伟达、AMD完全不同。它的旗舰芯片“Ma verick-2”采用的是一种智能数据流架构。简单来说,这种架构能通过软件定义的数据流硬件,在运行时动态重构和优化自己,芯片可以实时重新编程以更高效地运行特定任务。在能效方面,数据流架构减少了数据在内存和计算单元之间来回搬运的消耗,优势明显。
对于这种新架构,桑迪亚国家实验室负责测试新型计算架构项目的高级科学家James Laros给出了积极评价:“NextSilicon的性能结果令人印象深刻,它展现出一种潜力——在无需对现有代码进行大量修改的情况下,就能显著提升计算能力。”
就在近期,桑迪亚国家实验室、NextSilicon以及负责系统集成的Penguin Solutions联合宣布,搭载NextSilicon芯片的超级计算机系统,已经通过了一系列通用超算测试的关键技术里程碑。这意味着,它已经获得了“入场券”,可以在今年秋季接受更贴近核安全实际工作的高难度计算任务测试。
Laros道出了实验室与初创公司合作的深层逻辑:构建一个多元化的芯片采购体系。这样一来,即便头部芯片巨头们未来彻底转向其他赛道,实验室也能持续、稳定地获得满足科研任务的算力芯片。
“我们必须确保自己有可用的选择来完成使命,”Laros强调,“因为这项使命,没有退路。”
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9