发布于2026-07-23 阅读(0)
扫一扫,手机访问
还记得2016年谷歌首次公开TPU那会儿吗?外界对它的理解其实挺单纯的——“啊,这就是一颗为深度学习量身定做的专用芯片。”当时,AI的主战场还在训练环节,GPU靠着通用性和成熟的生态,稳稳占据着绝对优势的地位。
弹指十年,情况已经大不相同。大模型大规模进入推理密集期,智能体反复调用模型,长上下文带来了更重的输入负载。算力的衡量方式,也从过去看“峰值算力”,变成了更关注单位Token的性价比。
这个变化很快传导到了国内市场。国产大模型迭代速度惊人,DeepSeek、Qwen、GLM等模型持续更新,几家国产芯片厂商也在拼命寻找更具体的落点:芯片能不能适配模型?集群能不能稳定运行?调用成本能不能被客户接受?
就在最近的WAIC期间,中昊芯英发布了第二代自研TPU芯片“须臾”,同时宣布华东地区首个国产TPU智算千卡集群在杭州正式落成。

大模型训练依然昂贵,但训练是一段相对集中的投入,而推理是一笔持续发生的成本账。用户每一次与AI的交互,背后都在消耗Token。智能体的出现更是放大了这个消耗过程——一个任务可能包含多轮检索、多次调用模型和连续生成,输入Token与输出Token的比例也可能相差悬殊。
中昊芯英创始人、CEO杨龚轶凡点出了一个关键趋势:当前大模型推理正在走向PD分离。所谓PD分离,就是把模型处理输入内容的Prefill阶段,与逐Token输出内容的Decode阶段拆开调度。前者需要快速处理大量上下文,后者更看重持续输出和低延迟。如果把两种任务放在同一套资源里跑,很容易出现资源闲置或排队。拆开之后,集群就可以围绕不同负载进行更细致的配置。
这也是TPU再次获得关注的根本原因。GPU最初是为图形渲染设计的,后来凭借强大的并行计算能力成为AI训练的核心硬件。而TPU从一开始就瞄准了深度学习中的张量计算,它牺牲了一部分通用性,换来了在特定任务中的计算密度和能效表现。谷歌把TPU用在自家数据中心和云服务上,已经证明了专用架构在大规模AI负载中能找到自己的位置。
不过,国内的情况要复杂得多。GPU生态长期占据主导地位,CUDA工具链和开发习惯构成了很高的迁移门槛。国产TPU想进入市场,既要解决芯片本身性能问题,也要回答几个现实问题:开发者怎么迁移?模型怎么适配?客户怎么调用?
须臾是中昊芯英的第二代产品。据官方透露,这款芯片的混合精度浮点算力达到了896TFLOPS,8-bit推理算力达到1792TOPS,整体性能约为上一代芯片的三倍,单芯片额定功耗为600W。中昊芯英联合创始人、CTO郑瀚寻把性能提升归结为几项硬件调整:计算流水线重构、双芯粒同基板封装,以及片上存储容量和带宽的提升。中昊芯英称,目前已经完成Qwen、DeepSeek、GLM等主流开源模型的基础适配,并能在新模型发布后较快地跑通流程。
但话说回来,基础适配跟商业化效果之间还有不小的距离。要把模型的吞吐量、延迟和成本调到可用水平,往往需要围绕算子、编译工具和调度策略持续优化。国产AI芯片行业常说的“从可用到好用”,背后指的就是这段漫长的打磨过程。
这次落成的杭州国产TPU千卡集群,由杭州电信、中兴通讯和中昊芯英共同建设,面向大模型训练、推理和科学计算等场景提供算力服务。它也是中国电信体系内首个大规模国产TPU集群部署项目。
运营商的角色也在发生变化。过去,客户租用的是服务器、存储和带宽;现在,越来越多的企业希望直接获得模型调用能力,或者按照Token来购买服务。杭州电信并没有把TPU当成唯一选项,他们的现有布局中同时包含GPU算力池,也在探索其他国产芯片路线。未来的智算中心很可能长期保持异构状态——不同芯片架构各自承担擅长的任务,运营商负责把底层资源组织成面向用户的服务。
这种模式对集群调度提出了更高要求。杭州电信方面透露,经过数月软硬件调优,TPU集群的Token输出效率较年初提升了超过10倍。这个数字是系统优化综合作用的结果——模型版本、算子实现、服务器配置、网络带宽和调度方式,都会影响最终能交付多少有效Token。
中兴通讯承担了网络和系统集成能力。千卡集群向万卡规模扩展时,芯片之间的连接会迅速成为瓶颈。计算能力提升得越快,通信、存储和散热就越容易拖住整体效率。这些都是智算中心走向规模化后绕不开的问题。
谷歌TPU的经验已经说明,专用芯片的价值往往建立在完整的软硬件体系之上。对于国内厂商而言,芯片研发、量产交付和软件生态,仍需同步推进。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9