商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 智谱(02513)推出GLM-5.1高速版API 400 tokens/s刷新全球速度上限

智谱(02513)推出GLM-5.1高速版API 400 tokens/s刷新全球速度上限

  发布于2026-05-22 阅读(0)

扫一扫,手机访问

大模型API的速度天花板,又被刷新了。5月22日,智谱面向部分企业客户正式开放了GLM-5.1高速版API(GLM-5.1-highspeed),其模型输出速度达到了惊人的每秒400个token。这不仅一举刷新了全球大模型厂商的API速度上限,更重要的是,它首次在国产大模型中实现了旗舰级能力与极致低延迟的双重突破。

智谱(02513)推出GLM-5.1高速版API 400 tokens/s刷新全球速度上限

长久以来,行业里似乎有个不成文的“潜规则”:想要速度快,往往就得在模型能力上做些妥协,也就是所谓的“快即小”。但这次的高速版,彻底打破了这种固有认知。企业用户终于可以不用再为了响应速度而牺牲模型的质量了。

这种优势在代码编程这类对速度极度敏感的场景中,体现得淋漓尽致。想想看,一个Coding Agent任务常常需要数十轮的模型调用,如果每一轮都要等待数秒,整个开发流程的流畅度就会大打折扣。而高速版带来的“即问即答”体验,直接改变了传统模型多轮调用耗时久的痛点,让大模型开始真正像一个实时协作的伙伴,而不仅仅是一个离线工具。

实测数据更能说明问题。在代码生成任务中,效率提升了约10倍,模型不仅能快速生成代码,还能同步理解整个工程上下文,给出更贴合实际的方案。更令人印象深刻的是,在3D场景建模中,文字输入能与场景实现实时联动;它甚至能即时生成匹配用户需求的工具与交互界面,这已经初步具备了新型操作系统的雏形。

如此强悍的性能,背后是扎实的技术堆栈优化。这个API由智谱的GLM团队与TileRT团队联合打造,从推理引擎、调度系统到基础设施,进行了三层深度优化:重写核心推理路径以提升单卡吞吐量;通过动态批处理与KV缓存调度来降低尾延迟;并对集群与网络进行协同优化,从而确保每秒400个token的稳定输出。

其中的核心突破,在于自研的TileRT推理引擎。它通过编译期的静态编排与Tile级微任务调度技术,最大限度地消除了计算过程中的冗余开销,让计算效率逼近硬件的物理极限。

目前,GLM-5.1高速版已经针对AI编程、实时交互、商业决策、实时语音等高敏感场景进行了适配,并在智谱的MaaS平台上定向开放。可以预见,随着推理引擎的持续优化和高速服务覆盖范围的扩大,智谱正在为企业提供兼具低延迟与高智能的生产级AI能力,进一步巩固国产大模型在全球技术前沿的领先地位。

本文转载于:https://www.163.com/dy/article/KTHAMEVM05198UNI.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注