商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > OpenAI挑战AI评测基准SWE-Bench Pro:约30%存在评测缺陷

OpenAI挑战AI评测基准SWE-Bench Pro:约30%存在评测缺陷

  发布于2026-08-15 阅读(0)

扫一扫,手机访问

OpenAI昨天(7月8日)发布博文,直接对行业权威评测基准SWE-Bench Pro开火——在731个公开测试任务中,大约30%存在评测缺陷。这可不是小事,毕竟SWE-Bench Pro由Scale AI推出,专门衡量大语言模型和AI智能体的编程能力,高度贴近真实企业级开发,防作弊标准也极高,早已成为软件工程领域的“裁判员”。连裁判都被质疑,行业自然炸开了锅。

数据最能说明问题:前沿模型在8个月内,通过率从23.3%一路飙升至80.3%。进步当然可喜,但OpenAI认为,这个基准已经失效——它再也无法有效评估模型的软件开发能力了。


OpenAI详细拆解了审查流程:第一路是数据点分析,标记出200个失效任务,占全部731个公开任务的27.4%;第二路是并行的人工标注,识别出249个失效任务,占比34.1%。两条路径交叉验证后,估测大约30%的任务存在缺陷。

具体问题被梳理为四大类:

测试过于严苛——把题面根本没写明的实现方式也列为硬性要求;提示不充分——隐藏测试要求一些无法从题面合理推断出来的细节;测试范围过窄——不完整的修复也能轻松通过;提示具有误导性——指向与测试要求完全不一致的行为。

有一个典型例子特别说明问题:题面要求把内容转成Markdown时,行首只加1个空格,但隐藏测试却要求2个空格。模型按说明老老实实写代码,结果被判错。这种“标准不对齐”的坑,别说AI,资深开发者碰上也得抓狂。


基于这次分析,OpenAI直接撤回此前对SWE-Bench Pro的采用建议,并表态:后续需要由资深软件开发者专门为AI评测设计新的基准。毕竟,裁判都不靠谱,比赛结果还有什么意义?

本文转载于:https://www.163.com/dy/article/L1DIB9HU0511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注