发布于2026-08-21 阅读(0)
扫一扫,手机访问
这项由牛津大学、SoftServe、麻省理工学院、香港中文大学、英国AI安全研究所、Eigent.AI以及香港中文大学(深圳)等多家机构联合发起的研究,于2026年6月发布,论文编号为arXiv:2606.14397。
不知道你有没有注意到,最近几年"AI智能体"这个词几乎无处不在。所谓AI智能体,简单说就是能帮你在电脑上自主完成任务的AI系统——它能打开网页、点击按钮、填写表单、提取信息,甚至操作复杂软件。在许多人的印象里,这些系统已经相当厉害了,不少测试结果也显示它们的表现越来越接近人类。
然而这篇论文的研究团队抛出了一个值得警惕的问题:人们用来测试AI智能体的那些考题,是不是太简单了?这就好比只考一个学生会不会数1加1等于几,然后就宣称"这个学生的学业能力已经接近成年人水平"——显然不够说明问题。
正是基于这样的担忧,研究团队设计并发布了一套名为GauntletBench的全新测试平台。"Gauntlet"在英文里有"严酷考验"的意思,这个名字已经暗示了它的定位——不是来给AI系统镀金的,而是来真实检验它们边界的。
研究结果令人意外:即便是当下最顶尖的AI智能体系统,在这套测试中也只能完成不到两成的任务,而普通的非专业人类参与者却能轻松完成超过八成的任务。这道巨大的鸿沟说明,AI智能体的真实能力与人们通常想象之间存在相当明显的落差。
要理解这项研究的意义,先得搞清楚一件事:人们平时用来衡量AI智能体能力的那些测试,到底在考什么?
研究团队发现,目前绝大多数AI智能体测试基准都有两个共同问题。第一个问题是"考的都是熟悉的地盘"。那些测试通常选取AI系统极有可能在训练数据中见过的应用场景,比如亚马逊购物、酒店预订系统、常见的企业客户关系管理软件。AI在这些界面上游刃有余,部分原因是它们已经在无数类似的网页交互记录中"见过世面"。这就像考一个学生只考他背过的原题,分数自然好看,却不能说明他真正理解了知识。
第二个问题是"考的技能太单一"。大多数测试重点考察的是UI导航(就是在网页上找到按钮并点击)、表单填写、信息检索这几类任务。这些确实是有用的能力,但现实世界中的复杂任务往往需要更多。比如,当你需要剪辑一段视频,你不仅要会点击软件按钮,还需要理解时间轴上各个片段的时间关系;当你分析飞机航班数据,你需要在地图上判断空间位置和飞行轨迹。这些能力,现有测试几乎从不涉及。
正因如此,AI系统在现有基准测试上的高分,并不能真实反映它们在更广泛、更复杂任务上的表现。研究团队把这个现象称为"性能饱和"——分数已经高得没有区分度,却不能真正告诉我们这些系统的局限在哪里。
针对上述问题,研究团队打造了GauntletBench。如果说现有的测试基准是一套只考基础算术的考卷,那GauntletBench就是一套同时考察数学推理、空间想象和时间判断的综合能力测验。
这套测试平台特别关注三种在现有测试中几乎完全被忽视的能力。第一种是时间感知能力,也就是理解事物在时间维度上的变化和顺序的能力——比如判断哪架飞机最后一个离开某个区域,或者确定两个视频片段交接的精确时间点。第二种是图形理解能力,指的是理解复杂视觉界面中各个元素之间关系的能力——比如读懂电路图中电流的流向,或者识别工作流程图中节点的连接逻辑。第三种是三维空间推理能力,指的是在三维场景中判断物体位置、大小和空间关系的能力——比如计算把一个圆锥放在圆柱顶部,圆锥底部应该在什么坐标上。
为了考察这三种能力,研究团队专门设计了五个应用场景,每个场景都是一个完整的网页应用软件。这五个场景分别是:视频编辑器(一个时间轴式的视频剪辑工具)、工作流构建器(一个基于节点的自动化流程设计工具)、三维建模器(一个三维场景编辑工作台)、航班分析器(一个飞行雷达地图和历史数据回放工具)以及电路设计器(一个在浏览器中运行的电路仿真器)。
这五个应用都是用真实的现代网页技术搭建的,具备真实软件的复杂性和交互逻辑,而且界面风格与AI系统在训练数据中最常接触的那些"熟悉面孔"大相径庭,从而有效避免了AI靠"死记硬背"蒙混过关。每个应用提供20道任务题,全部100道题分为简单、中等、困难三个难度层次。
在测试设计上,研究团队还花了大量心思解决一个棘手问题:如何自动化、客观地给AI的答案打分?他们为每个应用场景量身定制了专属的评判逻辑。举个例子,在视频编辑器场景中,评分系统允许100毫秒的时间误差,因为即便是人类也无法把视频剪辑精确到帧;在颜色匹配方面,它能识别不同格式的颜色表达(比如RGBA和RGB),不会因为格式差异而错判。在航班分析场景中,涉及多架飞机的题目采用顺序无关的集合匹配,确保答案内容正确但顺序不同时不被误判为错误。在电路设计场景中,判断答案是否正确的方法是直接运行仿真,枚举所有输入组合验证输出是否与标准答案一致,这种"真值表等价"的判断方式远比字符串对比更准确也更公平。
除了判断任务是否完成,这套平台还引入了"进度评分"这一辅助指标。即便一个AI系统最终没能完成任务,如果它在过程中取得了实质性进展,也能得到部分分数,这样可以更细腻地刻画AI的实际能力水平。进度评分由另一个大型语言模型担任"裁判",通过审阅AI的操作截图序列和最终状态来打分,分值从1分(完全没有进展)到5分(完全成功)不等。
研究团队对14个当前最先进的AI智能体系统进行了全面测试,涵盖开源、闭源API调用以及完整的闭源智能体框架三大类别。
开源的大型多模态语言模型表现最为令人失望。Gemma-3-27B、Mistral-Large-3、Qwen3-VL-32B、Llama-4-Ma verick等主流开源模型,在GauntletBench上的任务完成率几乎全部归零。大多数系统在100道题里一道都完不成,个别表现稍好的也只能偶尔完成零星几道。研究团队发现,这些模型的失败并不仅仅是理解能力不足,还有很多是执行层面的根本性问题——比如输出格式不符合要求导致操作无法执行,或者陷入反复执行同一个无效动作的死循环。这背后的原因很可能是这些模型的训练数据几乎不包含真实的多步骤浏览器操控记录,它们擅长单轮对话,却不擅长在一个动态变化的软件界面里持续协调多个步骤。
通过API调用的闭源大型多模态语言模型表现稍好,但仍然相当有限。Qwen-Max的平均完成率只有0.3%,OpenAI的o3-pro同样只有0.3%,GPT-5.4达到2.3%,Claude-Opus-4.6达到12.3%,而谷歌的Gemini-3.1-Pro则以13.2%的成绩成为这个类别中的最佳表现者。
完整的闭源智能体框架表现最好,但依然远未达到令人满意的水平。GPT Computer Use(即GPT计算机使用工具)的完成率只有4.3%,谷歌的Gemini Enterprise达到13.7%,而Anthropic的Claude Opus 4.6 Computer Use以19.1%的完成率成为所有测试系统中的冠军。
与此形成鲜明对比的是,普通的非专业人类参与者——也就是那些具备相关工具使用背景但并非专家的普通人——在五个应用场景中的完成率都在75%到85%之间,平均达到80.8%。更值得注意的是,这些人类参与者完成任务所用的操作步骤,比最好的AI系统少了整整30%。换句话说,人类不仅完成得更多,而且完成得更有效率。
从难度分层的数据来看,规律更加清晰。在简单任务上,最好的AI系统(Claude Opus 4.6 Computer Use)能完成大约43%,表现尚可;而在中等难度和困难任务上,完成率分别急剧下降到不足15%和不足10%。随着任务复杂度的增加,AI系统的表现呈现出显著的"断崖式"下降,而人类参与者在不同难度层次之间的表现则相对稳定。
从五个场景的横向对比来看,航班分析器和电路设计器是所有AI系统最难攻克的两个场景,即便是最好的AI系统在这两个场景的完成率也只有11.7%。研究团队认为,这说明当前AI系统对图形元素的基本识别能力已经初步具备,但对这些元素之间的关系、交互方式以及由此产生的系统行为的深层理解,依然严重不足。
进度评分的数据则提供了一个相对乐观的视角。几乎所有AI系统都能获得高于1分的进度评分,说明它们并非毫无建树——它们能理解任务、制定计划、执行若干有意义的步骤,只是在最后冲刺阶段容易出错或卡住。Claude Opus 4.6 Computer Use的平均进度评分甚至超过了满分5分的50%(即3.1分),这意味着失败往往不是因为AI系统完全不知道该做什么,而是因为在需要精准执行多个连续步骤时,错误会逐步积累并最终导致任务失败。
研究团队还做了一系列对照实验,来回答几个实际操作中的关键问题。
关于模型规模的影响,团队分别测试了GPT-5.4的三个版本(Nano、Mini和完整版)以及Claude-4.6的三个版本(Haiku、Sonnet和Opus)。结果清晰地显示,模型规模越大,任务完成率和进度评分就越高。有趣的是,在中等难度任务上,最大的模型消耗的总token数(可以理解为计算资源)反而比小模型更少——因为大模型能更快找到正确路径,而小模型会在错误尝试上反复消耗资源。这说明对于GauntletBench这类有挑战性的任务,单纯增加操作步骤是没有用的,必须依靠更强的基础模型能力。
关于推理模式的影响,团队对比了启用和不启用扩展推理(即让模型在给出答案前先进行更长时间的思考)两种模式下的表现。对于能力足够强的模型,启用扩展推理确实有帮助:Gemini-3.1-Pro在高推理模式下的完成率(13.2%)明显高于低推理模式(6.3%)。但对于能力相对较弱的模型,这种额外的"思考时间"并没有带来实质性提升,反而大幅增加了token消耗。Claude-Opus-4.6在启用"思考模式"后完成率反而略有下降(从12.3%降至10.3%),虽然差异在误差范围内,但也说明推理模式的效果高度依赖基础模型本身的能力水平。
关于视觉输入的必要性,团队在视频编辑器和工作流构建器两个场景中对比了纯文本模式(只提供界面结构信息,不提供截图)和多模态模式(同时提供截图和界面结构信息)。结果发现,仅靠文本结构信息只能完成极少数任务,而加入视觉输入后,Qwen系列模型的进度评分提升了43.5%,GPT系列提升了15.5%。这证明了GauntletBench确实在考察真实的视觉理解能力,而非可以通过解析网页代码绕过的表面技能。
研究团队通过人工审查大量失败的操作记录,归纳出四类反复出现的典型错误模式。
第一类错误是"不知道什么时候该停手"。一方面,AI系统会在任务已经正确完成之后继续执行操作,最终把正确的结果破坏掉。比如在三维建模场景中,AI可能已经把物体移动到了正确坐标,却继续点击、拖拽或修改其他属性,导致最终状态与要求不符。另一方面,AI系统也会过早宣告任务完成,在只做了一半的情况下就输出"已完成"的信号。这两种错误在GPT系列模型中尤为突出——它们在文字输出中声称任务完成了,但实际的软件状态与要求还差得很远。
第二类错误是"指哪打不到哪",专业上称为"基础定位失败"。AI系统明明知道要点击"地图节点",但实际点击的是旁边的工具栏按钮;明明知道要在某个输入框里填数字,却把数字填进了旁边另一个框里。更让情况雪上加霜的是,这类错误往往不会产生任何报错信息——从浏览器的角度看,操作确实被执行了,只是执行在了错误的地方。AI系统感知不到这个偏差,于是继续在错误的基础上叠加后续操作,越走越偏。
第三类错误是"不按规则出牌"。研究团队在提示词中明确要求AI系统每次只执行一个操作,然后等待反馈再继续。但不少模型无视这个要求,一次性输出完整的操作计划却不实际执行任何动作,或者把多个步骤打包成一个回复。Llama-4-Ma verick尤其典型,它会直接输出一整套计划然后结束对话,实际的软件界面纹丝未动,却在形式上"完成了"整个流程。
第四类错误是"开源模型的系统性失败"。几乎所有开源模型产生的操作序列都存在格式错误,或者会陷入反复执行同一个无效操作的死循环,或者在只尝试了几步之后就放弃了。研究团队认为这主要是训练数据的问题——这些模型几乎没有接受过真实的多步骤浏览器控制场景的训练,它们擅长的是单轮问答,而不是在一个持续变化的软件状态中长程决策。
说到底,这项研究在做一件很朴素的事:帮人们更诚实地认识AI智能体的真实水平。
研究团队并不是说AI智能体没有价值,而是指出,当前的评测体系给了人们一个过于乐观的印象。就像如果只考学生背诵能力,就宣称他已经具备完整的学习能力,这个结论显然经不起推敲。GauntletBench的贡献在于,它揭示了一批真实存在但此前被系统性忽视的能力短板——对时间序列的感知、对复杂图形关系的理解、对三维空间的推理。
从实验数据来看,当前最好的AI智能体距离在复杂真实场景中可靠工作,还有相当长的路要走。不过,进度评分的数据也表明,现有系统并非完全无能——它们能理解任务、制定计划、执行部分正确步骤。失败往往不是因为能力为零,而是因为在需要精确、持续、长程协调多个操作时,错误会累积到临界点。这给了研究者和开发者一个方向:提高AI系统在执行层面的可靠性,尤其是基础定位的准确性和任务完成状态的判断能力,或许比单纯追求模型规模更为关键。
对于普通用户而言,这意味着在把AI智能体应用于复杂工作流程时,应该保持适度的期望,并在关键节点保留人工审查。AI系统在简单、结构清晰的任务上已经相当有用,但一旦任务需要深层视觉理解或跨步骤的精确协调,当前系统的表现就难以令人放心。
研究团队也坦承了这项工作的局限。GauntletBench目前只覆盖了五个专业领域,不能代表所有可能的真实场景;测试对AI的观察方式(限制为截图而非完整的底层网页代码)也可能在某种程度上限制了AI系统发挥其全部潜能。未来的计划包括扩展到更多应用场景,引入更长链条的任务,以及增加对安全性、鲁棒性和失败恢复能力的评估维度。
归根结底,衡量一件工具好不好用,不能只在它熟悉的场合里测试它。只有在陌生的、复杂的、有真实挑战的环境里观察它的表现,人们才能知道它真正能胜任什么工作。GauntletBench做的,正是这件事。
Q1:GauntletBench和现有AI智能体测试平台有什么本质区别?
A:GauntletBench专门针对时间感知、图形理解和三维推理这三种被现有测试大量忽视的能力,选取了五个AI不熟悉的专业应用场景进行考察,而现有测试通常用AI训练时见过的常见界面做评测,容易高估AI的真实泛化能力。
Q2:Claude Opus 4.6 Computer Use既然是最好的系统,为什么完成率还不到20%?
A:这恰恰说明任务本身的设计有效地规避了AI靠"熟悉界面"取巧的可能性。该系统在进度评分上表现不错(3.1/5),说明它能理解任务并取得部分进展,但在需要多步骤精确协调的复杂任务上,错误会逐步积累,导致最终无法完全达到要求。
Q3:非专业人类参与者是怎么做到80%以上完成率的,他们接受了专业培训吗?
A:没有专业培训。参与者只在任务开始前观看了一段简短的应用演示视频,使用的是与AI完全相同的软件界面和任务描述。他们的优势来自人类天然的常识判断、灵活的视觉理解和对任务完成状态的准确感知,这些正是当前AI系统最薄弱的地方。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9