云天励飞:正在研发的推理芯片引入3D堆叠存储架构
云天励飞正研发下一代推理芯片,采用GPNPU架构以解决大模型推理的效率与成本挑战。该芯片强调通用编程能力以兼容现有生态,优化NPU内核提升能效比,并引入3D堆叠存储架构突破内存瓶颈。此外,通过算力积木架构可构建超节点以支持超大规模模型,旨在显著降低推理成本,推动AI应用普惠化。
近日,云天励飞在公开披露的投资者关系记录中,详细介绍了其正在研发的下一代推理芯片。这款芯片的核心技术路线,围绕一个名为GPNPU的架构展开,旨在系统性地解决当前大模型推理面临的效率与成本挑战。其技术亮点主要聚焦于四个关键层面。
一、GPGPU级通用编程能力:破解“易用性”难题
国内芯片产业常面临一个现实痛点:生态壁垒高,客户迁移成本大。针对这一点,云天励飞的GPNPU架构将“通用编程能力”放在了首位。该架构强调对CUDA等主流开发生态的兼容与迁移支持,这意味着开发者在现有框架下训练的模型,能够以更低的门槛部署到新芯片上。这无疑是为客户扫清了采用国产芯片的一大障碍,让技术切换变得平滑。
二、极致能效的NPU内核:追求推理性价比
光有通用性还不够,推理芯片的核心竞争力最终要落到能效比上。公司的第二项技术重点,便是对NPU内核进行深度优化,专门针对推理场景的计算特性进行设计。目标很明确——在单位功耗下,榨取出更高的推理性能,从而直接提升整个推理任务的性价比。这对于需要大规模、长时间运行模型的场景来说,是降低运营成本的关键。
三、引入3D堆叠存储架构:突破“内存墙”瓶颈
随着模型参数量的爆炸式增长,传统的存储架构已成为制约算力发挥的“内存墙”。数据在存储器和处理器之间的搬运速度,往往赶不上计算速度,造成算力闲置。为此,云天励飞在这款推理芯片中引入了3D堆叠存储架构。简单来说,这种技术能让存储单元更“贴近”计算核心,从而获得更高的数据带宽和更低的访问延迟。这相当于拓宽了数据供给的“高速公路”,让强大的算力引擎能够持续“饱腹”工作,从而显著提升整体推理效率。

四、算力积木架构:构建Scale-up超节点
面对未来万亿参数乃至十万亿参数级别的MoE架构大模型,单颗芯片的算力可能捉襟见肘。云天励飞的应对策略是“化零为整”。公司基于过去五年在国产工艺上的技术积累,提出了“算力积木”架构。其理念是,像搭积木一样,利用下一代芯片单元构建出机架级的Scale-up超节点。这种设计能够灵活地聚合大规模算力,以满足超大规模模型对庞大体量、高带宽互联的极致推理需求。
目标:指数级降低Token成本,推动应用普惠
综合以上四点技术路径,云天励飞的目标清晰而宏大:通过芯片底层的系统性创新,实现推理Token成本的指数级下降。只有当推理成本降到足够低时,大模型技术才能真正走出实验室和高成本试点的局限,实现大规模的商业化应用与普惠化落地。这不仅是单一产品的目标,更是推动整个AI产业向纵深发展的关键一步。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















