商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 清华&OPPO联合打造"智能侦探":AI学会主动追查证据准确率飙升27%

清华&OPPO联合打造"智能侦探":AI学会主动追查证据准确率飙升27%

  发布于2026-08-20 阅读(0)

扫一扫,手机访问

说个真实的场景:你拍了张公园的照片,想知道这公园在哪个城市,结果手机AI助手要么给你个不着边际的答案,要么干脆说“不知道”。这事儿听着简单,背后其实藏着一个相当棘手的AI难题——怎么让机器在看图的同时,还能主动去翻找那些它本来不知道的知识?

最近,清华大学深圳国际研究生院、OPPO AI中心联合南洋理工大学搞了个挺有意思的解决方案。他们的思路是把AI设计成一个“主动侦探”:面对一张照片和一个问题,不瞎猜,而是主动出击——先看图找线索,再翻文字档案,直到证据凑齐了才下结论。这个系统叫ProMSA(Progressive Multimodal Search Agents,渐进式多模态搜索智能体),在两大主流测试集上的表现,比之前最强的对手高出了7到9个百分点。

这项研究已经在2026年6月26日挂到了arXiv上,编号arXiv:2606.27974。

一、侦探为什么比旁观者更聪明?

要搞明白这项研究的价值,得先弄清楚一个基本问题:为什么看图回答问题这么难?

表面上看,现在的AI能认猫狗、能理解文字、还能写诗作画,好像无所不能。可问题一旦碰上“冷僻知识”,AI立马露出短板——就像一位博学的学者被问到某个偏远小镇的街名,就算真去过,也未必能准确说出来。拿“图片里这个湖在哪个国家”举例,全球成千上万个湖泊,绝大多数在AI的训练数据里出现次数少得可怜,靠记忆根本回答不了。

现有的应对方案,基本走的是“先查后答”的路子——可以理解成一种图书馆查阅流程。系统先把图片拿去比对数据库,找出最相关的几个维基百科页面,再把页面内容喂给AI,让它根据这些材料作答。这个方法确实管用,但有三个硬伤。

首先是检索策略太死板。不管碰上什么情况,系统都只做同一件事——去翻同一个档案柜。而真正需要的是根据案情的不同,灵活决定该去哪里查、查什么。有些问题根本不需要检索,有些需要先识别图中实体再文字检索,还有些得来回追好几轮。一套固定流程根本应付不来。

其次是没有纠错机制。第一次检索如果拿到了错误页面,系统只能硬着头皮将错就错,完全没有回头重查的能力。这就像侦探翻到一份假证据,却毫无办法,最后只能做出错误判断。

第三,处理不了需要多步推理的问题。比如“图片里这位运动员效力的球队,主场球场容量是多少”,至少得两步:先识别运动员和球队,再查球场容量。一次性的检索根本搞不定。

正是冲着这三个痛点,研究团队设计了ProMSA——一个会主动调查的系统。

二、侦探的办案流程:渐进式搜索

ProMSA的核心思路,用一个侦探破案的比喻就能说清楚。每次接到一个“案件”(图片+问题),侦探不会立刻下结论,而是根据现有线索决定下一步行动,直到证据足够。

具体来说,侦探每一步有三个选择:发起图像搜索、发起文字搜索,或者宣布“证据够了,我有答案了”。这三个选项合起来叫“行动空间”。

图像搜索怎么工作?侦探把当前图片跟维基百科里数百万张图片比对,找出最相似的几张,然后抓取这些图片对应的页面内容。这一步主要用于识别图中的实体——这是什么建筑、这是哪个人、这是哪个地标。

文字搜索则是另一条线索:根据已知信息生成文字查询,去维基百科的文字内容里找具体属性。比如已经知道图片里是“马里乌奇竞技场”,接下来要回答“里面有什么类型的座位”,就得专门搜索这个球场的文字介绍。

特别巧妙的是“去重机制”。侦探每次查过的档案都会被记下来,下次检索时自动排除掉,避免在同一个错误证据上原地打转。这意味着,就算第一次图像搜索返回了错误实体,侦探可以重新发起搜索,这次绕开上次的错误结果,向更深处追踪正确答案。

整个过程中还有一个“预算”约束——图像搜索和文字搜索各自最多调用3次,防止无休止地查下去耗尽资源。一旦超出预算,必须给出当前最佳判断。

另外,每次检索返回的大量文字容易让侦探“信息过载”。系统专门设了一个“摘要员”,由另一个AI负责把维基百科页面压缩成与问题最相关的简短摘要,再交给侦探。这样一来,侦探每次读到的都是精炼的关键信息,而不是成千上万字的原始文本。

三、侦探是怎么被训练出来的

有了这套流程,接下来就是怎么教会侦探用好这些工具?

研究团队采用两阶段训练方案,可以理解为“先上基础培训课,再实战磨练”。

基础培训课叫“冷启动监督学习”。这阶段,团队从训练数据里抽了3000个问题,让一个初始版AI反复尝试,每次只保留那些格式正确、工具调用成功、并且最终答案正确的尝试轨迹,丢掉失败的。这就像筛选优秀答卷——只收录“做对了而且步骤清晰”的范例,然后让AI从这些范例里学习基本流程。这一步不要求学会高深策略,只要求能正确填写“工具调用表格”、按格式汇报推理过程。

实战磨练阶段用的是强化学习,更高级一些。团队从训练数据里取出15000个问题,让已经学会基本格式的侦探去实际办案,根据最终结果给奖励或惩罚。奖励机制由三部分构成:答案正确给高分,格式规范额外加分,而调用工具的次数越多则会被适当扣分——目的是鼓励侦探用最少的调查步骤解决问题。经过大量实战,侦探逐渐学会了什么时候该继续搜索、什么时候该下结论,以及用图像搜索还是文字搜索更合适。

四、训练算法的一个关键改进

在强化学习的技术细节上,研究团队发现现有方法有个隐藏问题,并提出了针对性改进。

现有主流强化学习方法更新AI参数时,会把本次尝试产生的总体偏差除以“生成了多少个词”来做归一化。逻辑是:词越多,每个词的平均贡献越小,所以需要相应调整更新幅度,避免超长文本导致训练信号过大。

但在侦探这个场景里,决定成败的关键不只是“写了多少字”,更重要的是“调用了几次工具、做了几轮调查”。一个侦探可能文字不多,但调用了3次工具;另一个写了大量分析,但只调用1次。两者的“决策复杂度”天差地别,但光按文字量归一化,训练信号就会跑偏。

研究团队提出的TN-GSPO(工具归一化的群体序列策略优化)方法,把归一化的分母从“生成词数”扩展为“生成词数 × (1 + 工具调用深度的函数)”。这样一来,工具调用越多的轨迹,更新幅度会相应调小,与实际决策复杂度更匹配,训练过程也更稳定。

从训练动态曲线看,使用原始GRPO方法的侦探在训练早期就迅速减少了工具调用次数——学会了“尽量少查案”来规避扣分,但代价是证据收集不足。而TN-GSPO训练出的侦探保持了合理的工具调用频率,在整个过程中逐步找到了查案深度与效率的平衡点。

五、侦探上场后的成绩单

研究团队在两个主流知识型视觉问答数据集上测试了ProMSA:Encyclopedic-VQA(E-VQA,约16.7万道题,涉及1.67万个维基百科实体)和InfoSeek(约130万道题,专门测“未见过实体”的泛化能力)。

在E-VQA上,仅凭自身知识作答的最新视觉语言大模型(Qwen3-VL-8B)准确率约25%,相当于侦探啥工具都不用,单靠记忆瞎猜。引入固定检索流程的最强对手REAL达到约45%。而ProMSA(Qwen3-VL-8B版本)在单跳问题上达52.2%,在全量测试上更达52.6%,领先优势很突出。

在InfoSeek上情况类似。这个数据集特别测试“未见过的实体”和“未见过的问题”两种泛化难度,ProMSA分别达到53.6%和53.3%,综合53.4%,同样显著领先。

团队还在OK-VQA这个更广泛的视觉问答数据集上做了测试,验证侦探技能的迁移能力。结果显示,用Qwen2.5-VL-7B的ProMSA达到82.7%,用Qwen3-VL-8B的版本更达到85.6%,都超过了此前专门针对OK-VQA设计的方法。这说明侦探学到的不是针对特定任务的技巧,而是真正通用的知识搜索能力。

在推理速度方面,ProMSA平均每个样本耗时1.8秒(约为最快方法EchoSight的1.5倍),但准确率比EchoSight高出约30个百分点。相比之下,Deepeyesv2的耗时是EchoSight的2倍,但准确率反而比ProMSA低约10个百分点。这意味着ProMSA在性能和速度之间取得了相当好的平衡。

六、拆开盖子看细节:每个设计的贡献有多大

研究团队做了一系列对照实验,搞清楚每件装备到底有多大用处。

先看训练阶段的贡献。从基础模型(仅有推理框架,未经训练)到冷启动SFT阶段,E-VQA综合准确率从32.8%提升至38.6%;再加上强化学习,进一步跃升至52.6%。冷启动解决的是“会不会用工具”,强化学习解决“用得好不好”,两者缺一不可。

再看工具配置。只给文字搜索工具时,E-VQA准确率27.6%,InfoSeek 36.8%——文字搜索在需要先识别实体的场景下表现很差,因为侦探连“被调查对象是谁”都没确认就去查属性,自然事倍功半。只给图像搜索工具时,E-VQA准确率34.7%,但InfoSeek只有21.4%——图像搜索擅长识别实体,但需要细粒度文字知识时就无能为力。两者同时配备,E-VQA和InfoSeek分别达到52.6%和53.4%,效果远超任何单一工具,证明了多模态自适应检索的必要性。

在工具调用预算方面,每种工具可调用2次时,E-VQA为48.2%;调用3次时最优,达52.6%;调用4次时略降至52.4%。这印证了“预算太少证据不足,预算太多引入噪声”的直觉。

在每次检索返回数量方面,返回Top-1时E-VQA为45.9%,返回Top-3时达最优52.6%,返回Top-4时略降至52.1%,同样呈倒U形曲线。

七、侦探是怎么决定“何时收手”的

研究团队还对侦探多轮调查中的行为做了细粒度分析,结果挺耐人寻味。

第一轮检索后,只有39.1%的检索结果包含了正确的维基百科页面——侦探的第一反应其实常出错,约六成情况需要进一步调查。这一轮,46.4%的情况是“检索错了但侦探选择继续查”,体现了自我纠错本能;但也有14.5%是“检索错了但侦探停下给出答案”,属于明显错判。

到第二轮检索后,检索准确率提升至48.8%,“检索正确并停下”的比例从32.4%升至45.5%,“检索错误但继续查”的比例从46.4%骤降至7.4%。这说明强化学习有效训练出了“找到可靠证据就及时收手”的判断能力。

当然,第二轮也出现了一个值得关注的模式:有相当比例是“检索仍然错误,但侦探停了”。研究团队分析,一方面是因为工具调用成本惩罚机制在起作用——继续查代价太高,侦探选择了妥协;另一方面也反映出对于真正“长尾”的冷僻实体,侦探有时确实无法判断证据是否可靠。这是当前版本的一个局限,也是未来可以改进的方向。

说到底,ProMSA做的事并不复杂:把AI从一个被动的“知识库”变成一个主动的“调查员”。但实现这个转变需要解决的问题却很精细——既要设计合理的调查工具,又要训练出恰当的使用策略,还要在效率和准确率之间找到平衡。冷启动加强化学习的两阶段训练、TN-GSPO稳定学习过程、双工具自适应切换覆盖不同类型的知识缺口——这些设计共同造就了最终的性能提升。

对普通用户来说,这项研究意味着未来的AI助手在面对“图中这是什么地方”“这个人物在哪里出生”等冷僻知识问题时,会有更大概率给出正确答案,而不是自信地瞎编。对研究者来说,TN-GSPO提供了一种更合理的多工具智能体训练范式,可以推广到其他需要外部工具调用的AI任务上。

想深入了解技术细节的读者,可以通过arXiv平台检索编号2606.27974查看完整论文,代码也在GitHub上开源了。

Q&A

Q1:ProMSA和普通的RAG检索增强方法有什么本质区别?
A:普通RAG是一次性检索后直接生成答案,检索策略固定,失败了没法纠正。ProMSA则像一个主动调查的侦探,能根据每一步的检索结果决定继续查还是停下来,还能在第一次检索失败后自动排除错误结果再次尝试,形成闭环的搜索推理过程。

Q2:TN-GSPO与GRPO相比解决了什么具体问题?
A:GRPO训练多工具智能体时,只按生成文字的数量来归一化训练信号,这会让AI倾向于“少用工具、少写字”来获得更稳定的优化信号,最终证据收集不足。TN-GSPO额外把工具调用次数纳入归一化分母,让训练信号强度与实际决策复杂度相匹配,从而引导AI在需要时合理使用多次工具调用。

Q3:ProMSA在什么类型的视觉问答问题上提升最明显?
A:ProMSA在涉及长尾实体(即训练数据中很少出现的偏僻实体)的知识型问题上提升最显著,尤其是那些需要先识别图中实体再追查其属性的问题,以及需要跨多个维基百科页面进行多步推理的问题。对于AI参数记忆中已有答案的常见知识,提升幅度相对有限。

本文转载于:https://www.163.com/dy/article/L0PL7BAO0511DTVV.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注