商城首页欢迎来到中国正版软件门户

您的位置:首页 >CPU 重回中枢|玄铁在开源架构香山上探索“空间多线程”,守住智能体时代的确定性

CPU 重回中枢|玄铁在开源架构香山上探索“空间多线程”,守住智能体时代的确定性

  发布于2026-07-30 阅读(0)

扫一扫,手机访问

520 TFLOPS、50 万卡集群、45% 的端侧增速……刚刚落幕的 WAIC 2026 上,AI 产业的叙事已经悄然转向。一个明显的趋势是,AI 正从“能说会道”的大模型阶段,迈入“能干活、能创造价值”的智能体时代。

智能体依赖的多智能体调度、工具调用、长期记忆管理等控制流密集型任务,让 CPU 重新站到了系统核心的位置,成为连接模型、工具与记忆的“总指挥”。与此同时也带来了更尖锐的工程命题:如何在上百个并发线程间,保持可预测的高性能?

玄铁给出的答案是“多线程”——资源从动态竞争改为静态分区,单线程性能几乎不受影响,尾部延迟低且稳定。这直接击中了 RL 沙箱、智能体工具调用与灵活调度三大场景的死xue。从 3 月与开芯院合作共研香山昆明湖 V3,到同期与开芯院、中兴的多线程研讨会,玄铁正把“源头开源、架构统一、生态合力”变成可验证的技术进展。



范式跃迁:Agentic AI 时代为什么需要 SMT?



达摩院首席科学家孟建熠在 WAIC 2026 发表演讲

过去两年,算力叙事几乎被 GPU 垄断。但当 AI 从“生成内容”跃迁到“自主执行完整任务链”的 Agentic AI 阶段,控制流密集型负载让 CPU 重回系统核心。智能体不再被动应答,而是持续进行任务拆解、工具调用、上下文管理与子智能体编排——全球围绕 Agentic AI 算力底座的竞争已全面展开。

7 月 17 日,在世界人工智能大会(WAIC)现场,由国家互联网信息办公室信息化发展局、中国科学院联合主办的“RISC-V 与 AI 融合发展论坛”上,阿里达摩院首席科学家孟建熠指出:在智能体的工作流总延迟中,高达 90.6% 发生在 CPU 端的工具处理环节。这意味着,当智能体任务变得复杂,CPU 的吞吐与响应速度直接决定了整个系统的天花板。单纯堆砌 GPU 算力,根本无法解决工具调用与逻辑协同的瓶颈。SMT(同步多线程)正是高性能 CPU 从“单核极致”走向“系统级算力释放”的关键架构能力。



在 x86 和 ARM 主导的服务器 CPU 市场中,SMT 已是数据中心和 AI 推理芯片的标配技术。而对于正在向高性能计算领域突破的 RISC-V 架构而言,SMT 的工程化水平将直接决定下一代 RISC-V 服务器 CPU 能否在单核性能已跻身国际第一梯队的基础上,实现系统级算力的进一步跃升。

在 Agentic AI 时代,智能体工作流对 CPU 多线程并发能力的要求越来越高——多租户 SLA 隔离、异步工具调用、推理与规划并行执行等场景,都需要 SMT 提供底层的硬件级支撑。



这套能力对三类 Agentic AI 场景至关重要。国际主流 CPU 产品(如英伟达 Vera CPU)对 Spatial SMT 的探索,已从侧面验证“确定性多线程”是智能体时代的刚需。

不同的是,玄铁正将这一能力在 RISC-V 开源架构上实现自主可控,并赋予其更灵活的生态适配性。在智能体时代,多线程的“确定性”与“隔离性”,将和绝对吞吐同等重要。

  • RL 沙箱:每个沙箱是一个独立线程,负责编译代码、运行测试,必须在固定时间窗口内完成,否则会拖慢 GPU 训练周期。空间多线程保证即使上百个线程全开,每个沙箱仍能获得可预测的高性能。
  • 智能体工具调用:一次用户请求可能触发多个工具调用(查数据库加执行脚本),这些任务不能因其他租户的请求而变慢。空间多线程提供强隔离,在多租户环境下依然能守住 SLA。
  • 灵活调度:运行时可在“1 线程/核(最大化单线程性能)”与“2 线程/核(提升吞吐)”之间动态切换,无需重启。



这一技术判断,正是达摩院玄铁深度参与 RISC-V 开源生态建设、推动 SMT 技术攻关的核心动因。

从 C910 到 C950,玄铁持续推动 RISC-V 架构从嵌入式向高性能方向突破。今年 3 月 24 日,在上海举行的 2026 玄铁 RISC-V 生态大会上,达摩院与开芯院、中科院软件所正式签署战略合作协议,明确将 SMT 列为联合研发的三大关键技术攻关方向之一,同时规划了 RISC-V 高性能软件生态共建与行业标杆应用孵化的合作路线。

目前,SMT 已经进入了实质性的技术协作阶段——达摩院团队深入 KMH-SMT 微架构代码分析,并提交了多个 PR 合入 XS-GEM5。

SMT 技术深潜:从微架构代码分析到系统性的性能优化



达摩院玄铁 RISC-V 处理器架构团队高级技术专家郝子轶在 SMT SIG 首期技术沙龙发表演讲

达摩院玄铁 RISC-V 处理器架构团队高级技术专家郝子轶分享了达摩院 SMT 工作组加入香山昆明湖 V3 联合研发以来的技术进展。团队基于 XS-GEM5 性能模拟器快速完成了 SPECint2006 切片运行,正推进 SPECint2017 切片准备。在微架构优化层面,团队围绕多个关键组件展开了深入分析与实验:

  • 针对 IQ 发射队列分配策略,发现全动态共享存在线程饥饿风险,引入 WM2 水平线保留策略有效缓解了 IQ 满载问题;
  • 对 ROB 重排序缓冲区的 dynamic borrowing 机制进行 6 组对照实验,发现 donor 线程判定过于灵敏,建议引入延迟滤波,将 donor 保留条目提升至 64 时获得约 0.5% 性能改善;
  • Preg 物理寄存器分配初步验证了从全共享向策略化分配转变的价值。



郝子轶同时分析了线程取值截流策略与 store buffer 跨线程反压问题,提出按线程拆分 store buffer 的优化方向。

面向未来,团队提出了明确的路线图:推动 SPECint2006 双线程性能从 20% 向 30% 迈进;同步推进 SPECint2017 切片;探索 SMT 向 4/8/16 线程扩展以应对 AI 并发场景;将资源分配策略参数化,构建可调优的策略矩阵;以及空间多线程的探索。他强调,团队以最大化开源贡献为衡量标准,分析成果必须转化为有效的代码合入——“Talk is cheap, show me the code”。

本文转载于:https://www.163.com/dy/article/L2ES9RM40511RIVP.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注