商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > Artificial Analysis发布全新基准:GLM-5.1取得全球开源SOTA

Artificial Analysis发布全新基准:GLM-5.1取得全球开源SOTA

  发布于2026-05-30 阅读(0)

扫一扫,手机访问

5月12日,全球权威评测机构Artificial Analysis发布了一项全新的基准测试——Coding Agent Index。这个新榜单有点意思,它不再单纯看模型本身的“纸面”能力,而是把目光投向了更实际的战场:衡量“Agent harnesses”(可以理解为智能体开发框架或工具链)与具体模型的组合,在解决真实世界编程任务时的综合表现。

评测覆盖了SWE-Bench-Pro-Hard-AA、Terminal-Benchv2和SWE-Atlas-QnA这几个主流且颇具挑战性的编程基准。结果出炉,格局一目了然:闭源模型中,Opus4.7(在CursorCLI环境中运行)拔得头筹;而在开源阵营里,GLM-5.1(在ClaudeCode中运行)的表现最为亮眼,拿下了开源第一的位置。

Artificial Analysis发布全新基准:GLM-5.1取得全球开源SOTA

这个结果传递出一个明确的信号:在贴近实际开发场景的编程智能体(Coding Agent)竞技场上,GLM-5.1所展现的能力,已经代表了当前国产大模型所能达到的顶尖水平(SOTA)。换句话说,当把模型放到具体的工具链和任务环境中去“实战”时,国产力量同样能交出世界级的答卷。这或许比单纯的理论分数,更能说明问题。

本文转载于:https://www.163.com/dy/article/KSOPHSJH0514R9P4.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注