发布于2026-08-15 阅读(0)
扫一扫,手机访问
OpenAI昨天(7月8日)发布博文,直接对行业权威评测基准SWE-Bench Pro开火——在731个公开测试任务中,大约30%存在评测缺陷。这可不是小事,毕竟SWE-Bench Pro由Scale AI推出,专门衡量大语言模型和AI智能体的编程能力,高度贴近真实企业级开发,防作弊标准也极高,早已成为软件工程领域的“裁判员”。连裁判都被质疑,行业自然炸开了锅。
数据最能说明问题:前沿模型在8个月内,通过率从23.3%一路飙升至80.3%。进步当然可喜,但OpenAI认为,这个基准已经失效——它再也无法有效评估模型的软件开发能力了。

OpenAI详细拆解了审查流程:第一路是数据点分析,标记出200个失效任务,占全部731个公开任务的27.4%;第二路是并行的人工标注,识别出249个失效任务,占比34.1%。两条路径交叉验证后,估测大约30%的任务存在缺陷。
具体问题被梳理为四大类:
测试过于严苛——把题面根本没写明的实现方式也列为硬性要求;提示不充分——隐藏测试要求一些无法从题面合理推断出来的细节;测试范围过窄——不完整的修复也能轻松通过;提示具有误导性——指向与测试要求完全不一致的行为。
有一个典型例子特别说明问题:题面要求把内容转成Markdown时,行首只加1个空格,但隐藏测试却要求2个空格。模型按说明老老实实写代码,结果被判错。这种“标准不对齐”的坑,别说AI,资深开发者碰上也得抓狂。

基于这次分析,OpenAI直接撤回此前对SWE-Bench Pro的采用建议,并表态:后续需要由资深软件开发者专门为AI评测设计新的基准。毕竟,裁判都不靠谱,比赛结果还有什么意义?
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9