OpenAI挑战AI评测基准SWE-Bench Pro:约30%存在评测缺陷
OpenAI指出,其SWE-BenchPro基准中约三成的任务存在缺陷,包括测试条件过于严苛、提示信息不充分等。例如,题面要求行首加一个空格,但隐藏测试却要求两个空格。OpenAI已撤回采用该基准的建议,并呼吁为人工智能设计新的评估基准。
OpenAI昨天(7月8日)发布博文,直接对行业权威评测基准SWE-Bench Pro开火——在731个公开测试任务中,大约30%存在评测缺陷。这可不是小事,毕竟SWE-Bench Pro由Scale AI推出,专门衡量大语言模型和AI智能体的编程能力,高度贴近真实企业级开发,防作弊标准也极高,早已成为软件工程领域的“裁判员”。连裁判都被质疑,行业自然炸开了锅。
数据最能说明问题:前沿模型在8个月内,通过率从23.3%一路飙升至80.3%。进步当然可喜,但OpenAI认为,这个基准已经失效——它再也无法有效评估模型的软件开发能力了。

OpenAI详细拆解了审查流程:第一路是数据点分析,标记出200个失效任务,占全部731个公开任务的27.4%;第二路是并行的人工标注,识别出249个失效任务,占比34.1%。两条路径交叉验证后,估测大约30%的任务存在缺陷。
具体问题被梳理为四大类:
测试过于严苛——把题面根本没写明的实现方式也列为硬性要求;提示不充分——隐藏测试要求一些无法从题面合理推断出来的细节;测试范围过窄——不完整的修复也能轻松通过;提示具有误导性——指向与测试要求完全不一致的行为。
有一个典型例子特别说明问题:题面要求把内容转成Markdown时,行首只加1个空格,但隐藏测试却要求2个空格。模型按说明老老实实写代码,结果被判错。这种“标准不对齐”的坑,别说AI,资深开发者碰上也得抓狂。

基于这次分析,OpenAI直接撤回此前对SWE-Bench Pro的采用建议,并表态:后续需要由资深软件开发者专门为AI评测设计新的基准。毕竟,裁判都不靠谱,比赛结果还有什么意义?
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















