发布于2026-05-30 阅读(0)
扫一扫,手机访问
5月12日,全球权威评测机构Artificial Analysis发布了一项全新的基准测试——Coding Agent Index。这个新榜单有点意思,它不再单纯看模型本身的“纸面”能力,而是把目光投向了更实际的战场:衡量“Agent harnesses”(可以理解为智能体开发框架或工具链)与具体模型的组合,在解决真实世界编程任务时的综合表现。
评测覆盖了SWE-Bench-Pro-Hard-AA、Terminal-Benchv2和SWE-Atlas-QnA这几个主流且颇具挑战性的编程基准。结果出炉,格局一目了然:闭源模型中,Opus4.7(在CursorCLI环境中运行)拔得头筹;而在开源阵营里,GLM-5.1(在ClaudeCode中运行)的表现最为亮眼,拿下了开源第一的位置。

这个结果传递出一个明确的信号:在贴近实际开发场景的编程智能体(Coding Agent)竞技场上,GLM-5.1所展现的能力,已经代表了当前国产大模型所能达到的顶尖水平(SOTA)。换句话说,当把模型放到具体的工具链和任务环境中去“实战”时,国产力量同样能交出世界级的答卷。这或许比单纯的理论分数,更能说明问题。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9