发布于2026-05-22 阅读(0)
扫一扫,手机访问
大模型API的速度天花板,又被刷新了。5月22日,智谱面向部分企业客户正式开放了GLM-5.1高速版API(GLM-5.1-highspeed),其模型输出速度达到了惊人的每秒400个token。这不仅一举刷新了全球大模型厂商的API速度上限,更重要的是,它首次在国产大模型中实现了旗舰级能力与极致低延迟的双重突破。

长久以来,行业里似乎有个不成文的“潜规则”:想要速度快,往往就得在模型能力上做些妥协,也就是所谓的“快即小”。但这次的高速版,彻底打破了这种固有认知。企业用户终于可以不用再为了响应速度而牺牲模型的质量了。
这种优势在代码编程这类对速度极度敏感的场景中,体现得淋漓尽致。想想看,一个Coding Agent任务常常需要数十轮的模型调用,如果每一轮都要等待数秒,整个开发流程的流畅度就会大打折扣。而高速版带来的“即问即答”体验,直接改变了传统模型多轮调用耗时久的痛点,让大模型开始真正像一个实时协作的伙伴,而不仅仅是一个离线工具。
实测数据更能说明问题。在代码生成任务中,效率提升了约10倍,模型不仅能快速生成代码,还能同步理解整个工程上下文,给出更贴合实际的方案。更令人印象深刻的是,在3D场景建模中,文字输入能与场景实现实时联动;它甚至能即时生成匹配用户需求的工具与交互界面,这已经初步具备了新型操作系统的雏形。
如此强悍的性能,背后是扎实的技术堆栈优化。这个API由智谱的GLM团队与TileRT团队联合打造,从推理引擎、调度系统到基础设施,进行了三层深度优化:重写核心推理路径以提升单卡吞吐量;通过动态批处理与KV缓存调度来降低尾延迟;并对集群与网络进行协同优化,从而确保每秒400个token的稳定输出。
其中的核心突破,在于自研的TileRT推理引擎。它通过编译期的静态编排与Tile级微任务调度技术,最大限度地消除了计算过程中的冗余开销,让计算效率逼近硬件的物理极限。
目前,GLM-5.1高速版已经针对AI编程、实时交互、商业决策、实时语音等高敏感场景进行了适配,并在智谱的MaaS平台上定向开放。可以预见,随着推理引擎的持续优化和高速服务覆盖范围的扩大,智谱正在为企业提供兼具低延迟与高智能的生产级AI能力,进一步巩固国产大模型在全球技术前沿的领先地位。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9