我国科研人员研发亚10毫秒级神经动力系统存内计算芯片
中国科学院上海微系统与信息技术研究所联合团队利用相变存储器精确可控的电导漂移特性,成功研制出亚10毫秒级神经动力系统存内计算芯片。在40纳米工艺下,单次迭代计算延迟低至2.12毫秒,计算速度提升3.82至36.27倍,功耗降低11.75至24.73倍,相比英伟达A100GPU综合性能高出50.38至478.18倍。
在芯片与计算架构的演进史上,存算一体化始终被视为突破“冯·诺依曼瓶颈”的关键路径之一。而最近,中国科学院上海微系统与信息技术研究所联合团队交出的一份答卷,让这条路径上的一个关键节点——相变存储器,有了新的想象空间。

这项成果发表在《科学》杂志上。核心亮点是:团队利用相变存储器精确可控的电导漂移特性,结合其多级存内计算能力,成功研制出一款亚10毫秒级的神经动力系统(NDS)存内计算芯片。一句话概括——他们找到了让相变存储器“边存边算”的实用化方案,并且已经在高保真几何建模这类高难度任务上跑通了。
要理解这个突破的价值,得先看它要解决什么问题。高保真物理世界的几何建模,需要在流形表面实现实时、密集且可微的变形场。传统上,基于自适应步长积分与嵌入式神经网络相结合的神经动力系统(NDS)可以支撑这类任务,但代价是延迟高达数百毫秒。对于实时交互场景,这个延迟几乎是不可接受的。
相变存储器本身并不陌生——它具备高速、低功耗、与CMOS工艺兼容、多阻态存储等特性,一直被视为下一代存储技术的有力竞争者。但这次团队走的不是“用相变存储器替代DRAM”的常规路线,而是把它当作一种功能性计算特征来用:利用其精确可控的多阻态存储和电导漂移两大特性,直接作为NDS的计算单元。这样一来,高密度存储和高并行度计算就能同时实现,而且精度有保障。
具体实现上,芯片采用了SET-RESET-DRIFT映射构建的贪婪算法搜索功能,跳过了传统数字电路中频繁读写、数据缓冲与乘法操作带来的延迟和功耗开销。工艺节点是40nm,采用1T1R相变单元实现存内计算。其中相变单元的刀片型小电极厚度做到了3nm,良率超过99.99999%,电导可进行16级以上高精度调控。这些参数意味着芯片在制造层面已经具备了很高的成熟度。
性能测试数据更直观。在10⁻⁷误差容限下,相比传统的NDS专用加速硬件,这款芯片的单次迭代计算延迟低至2.12毫秒,计算速度提升了3.82倍到36.27倍,功耗降低了11.75倍到24.73倍。而在最接近实际应用的场景——大脑皮层表面同步重建和三维流形网格生成上,与业界最先进的英伟达A100 GPU相比,NDS系统综合性能高出50.38倍到478.18倍。
当然,这还只是一颗研究级芯片,距离大规模商用还有距离。但它的意义在于,证明了相变存储器的电导漂移特性并非弱点,而是可以被驾驭的计算资源。当业界还在争论存算一体该走哪条技术路线时,这个团队已经用实打实的流片和测试数据,给出了一个高性价比的答案。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。














