当前位置:

首页 > 硬件相关 > 韩国世宗大学与NAVER Cloud揭开高分背后的惊天秘密

韩国世宗大学与NAVER Cloud揭开高分背后的惊天秘密

韩国世宗大学与NAVERCloud联合研究审查了14套视频AI测试集共24416道题,发现平均55%的题目存在“捷径”,AI无需理解视频即可答对。研究团队开发了Video-Oasis诊断工具,筛选出11033道真正需要视频理解的题目,测试显示当前顶尖模型得分仅略高于随机猜测,揭示了视频AI评估体系存在严重水分。

这项由韩国世宗大学与NA VER Cloud联合开展的研究,以预印本论文形式发布于2026年7月,论文编号为arXiv:2603.29616,有兴趣深入了解的读者可通过该编号查询完整原文。

你遇到过那种号称能“看懂视频”的AI吗?测试成绩看起来漂亮极了,但你有没有想过,那些高分可能掺了水——要是有一半以上的“高分题目”,根本不需要看视频就能答对,靠猜测、听声音、甚至看一张静止图片就能蒙混过关,那这个AI到底是真的懂了,还是只是运气好?

这正是这项研究的出发点。研究团队没有选择“再做一个新的测试集”这条老路,而是做了一件更有意思的事:他们像侦探一样,把现有的14套视频AI测试卷逐一翻出来仔细审查,结果发现了令人惊讶的规律——超过一半的题目存在“捷径”,AI完全可以绕过真正的视频理解来答题。这套审查工具被命名为“Video-Oasis”,可以说,它给当前视频AI领域的评估体系做了一次彻底的体检。

一、视频测试卷里藏着哪些“作弊通道”

要理解这个问题,先得用个考试来打个比方。假设你出了一道历史题:“1971年,IBM推出了哪款打字机?”本来想考学生历史知识,但考卷旁边恰好放了一段介绍IBM打字机的视频,视频里的旁白直接说出了答案,那这道题考的根本不是历史理解,而是“有没有开着音量”。

视频AI的测试卷里,类似的问题比比皆是。研究团队总结下来,发现至少有四条“作弊通道”。

第一条是“语言猜测”。有些题目问的是“键盘旁边哪个物体最近?”选项是碗、灯、砧板、鼠标——即便不看视频,靠常识也很容易猜到答案是鼠标,因为鼠标最常和键盘放在一起。AI不需要真正理解任何视频画面,只需要调动语言模型里存储的“常识”就能答对。

第二条是“音频替代”。有些视频里的旁白或对话直接包含了答案。比如问“某款打字机首次发布是哪年?”视频音轨里恰好有人说“这款机器于1971年首次亮相”,AI只需要把音频转成文字再找答案,压根不需要理解任何画面。

第三条是“单帧够用”。有些题目只要截取视频中间的一帧静止图片,就足以回答。比如“画面里天气怎么样”——晴天、雨天一眼就能从一张图里看出来,根本不需要看整段视频的动态变化。

第四条是“静态场景”。有些视频内容本身就是一个静止的场景,几乎没有任何时间上的变化,比如对着一个固定的房间场景问“壁炉在楼梯的哪个方向”——这道题在任何一帧都能答,完全不需要时间维度的理解。

研究团队把能通过以上任何一条捷径答对的题目,统称为“捷径题”。接下来的问题是:现有的测试卷里到底有多少这样的捷径题?

二、一次横跨14套测试卷的大审查

为了系统地找出捷径题,研究团队设计了一套名为Video-Oasis的诊断工具,它包含三类检查方式,就像医院体检时会分别检查血液、影像和体能一样,每类检查负责揭示不同类型的问题。

第一类是“视觉依赖检测”。研究团队让AI在三种刻意削弱视觉信息的条件下作答:完全不给任何视频或提示,只给问题和选项(也就是“盲猜模式”);把视频的音轨转成文字再交给AI;把视频按固定间隔截成若干帧,为每帧生成文字说明,然后把这些说明拼在一起代替视频。如果AI在任意一种条件下仍然能答对,就说明这道题不需要真正的视觉感知。

第二类是“时间依赖检测”。视频和图片最大的区别在于时间维度——视频是动态的、有先后顺序的。研究团队用三种方式破坏视频的时间结构:只给视频正中间的那一帧;把所有帧的顺序随机打乱;用一个完全不理解时间顺序的图像匹配系统(基于CLIP模型)去找和问题最相关的几帧来作答。如果AI在任意一种时间被破坏的条件下仍然能答对,就说明这道题不需要理解时间顺序。

第三类是“注释质量核查”。因为视频数据量大、内容复杂,很多测试卷在标注答案时本身就可能出错或者不够清晰。研究团队设计了三个检查:一致性检查(让五个不同的AI模型来回答,如果五个模型给出五个不同的答案,说明这道题本身就有歧义);冗余检查(把视频分成八段,如果每一段都能答对,说明这道题不依赖特定时间段的内容,标注可能有问题);敏感性人工核查(对那些“打乱帧顺序后仍答对”的题目,再由人工判断是否真的不需要时间顺序)。

为了确保诊断结论的可靠性,整个审查流程融入了多模型共识机制——只有当多个AI模型都能在削弱条件下答对时,这道题才被认定为捷径题,并额外配有人工复核环节,防止误判。

审查的最终结果令人震惊。在横跨14套视频理解测试卷、总计24416道题的大规模审查中,研究团队发现平均55%的题目是捷径题,也就是说一多半的题不需要真正理解视频就能答对。在放宽认定标准(只要有一个AI模型能绕路答对就算捷径)时,这个比例更是高达92.7%。

更有意思的是,研究团队还发现了一个规律:一套测试卷里捷径题越多,那套测试卷上的得分就越高。换句话说,AI得高分,很可能只是因为“捷径题多”,而不是因为它真的看懂了视频。这就像考试成绩好,并不一定是学生真的掌握了知识,而可能是出题人不小心出了太多送分题。

三、去掉捷径之后,AI的真实水平如何

去掉了那55%的捷径题之后,剩下的11033道题组成了Video-Oasis筛选出的“真正挑战集”。这些题涵盖了4938段独特视频,从几秒钟的短片到超过十分钟的长视频都有,而且都经过了严格的多重验证,确实需要对视频画面和时间顺序有深入理解才能作答。

研究团队把这些真正的挑战分成了五个类别,每个类别代表一种视频理解的核心能力。

第一类是细粒度感知,考察AI能否在时间和空间维度上识别细微的视觉变化,比如跟踪一个物体在多个角度下的外观,或者辨认视觉上相似但有细微差别的场景。第二类是空间世界理解,考察AI能否从多个视角合成出对三维空间的认知,比如推断物体之间的相对位置和几何关系。第三类是时间动态与追踪,考察AI能否追踪物体随时间的运动、识别动作序列、理解状态转变,这正是视频理解区别于图片理解的核心所在。第四类是因果与逻辑推理,考察AI能否推断出不直接出现在画面里的隐含原因和意图,比如从一系列事件中推断为什么某件事会发生。第五类是全局叙事理解,考察AI能否把散布在整段视频各处的片段信息整合起来,理解跨越较长时间跨度的故事走向。

接下来,研究团队用这套真正的挑战集,对目前市面上最顶尖的AI系统展开了全面测评。结果又一次令人大开眼界。

在标准4选1的题目里,随机猜测的正确率约为25.6%。测试结果显示,大部分开源视频AI模型的得分只比随机猜测略高一点点,比如Qwen2.5-VL拿到29.2分,Video-R1拿到26.3分,LongViLA-R1拿到28.6分——和蒙着眼睛乱猜几乎没有本质区别。就连来自谷歌、普遍被认为是当前最强大的多模态AI系统Gemini-2.5-Pro,总分也只有46.7分,距离满分还差得很远。在全局叙事理解这个最难的类别上,几乎所有模型都跌到了20%出头,某些模型甚至不如随机猜测。

这个结果非常直白地说明了一件事:当前的视频AI系统,在面对真正需要理解时间和空间的视频问题时,基本上还处于“懵逼”状态。那些在原有测试集上看起来很漂亮的高分,有相当大的水分。

四、什么样的设计能让AI看得更准

既然找到了问题,研究团队也顺势做了一系列实验,探索哪些技术设计能让AI在这些真正的挑战上表现得更好,结论颇为实用。

第一个实验探讨的是“精准定位”的价值。在回答视频问题时,如果AI能精准地找到视频中与问题最相关的片段,而不是机械地扫描整段视频,是否会有帮助?研究团队引入了一种叫做AKS(自适应关键帧采样)的方法,让AI先根据问题挑选出最相关的16帧再作答。结果显示,加入这个精准定位步骤后,AI的总体表现确实有所提升,Eagle2.5从31.5%升至32.9%,Qwen3-VL从27.8%升至30.1%。但提升的幅度并不大。

为了搞清楚这点提升是不是已经到了天花板,研究团队进行了一个“上限实验”:给AI直接提供视频中包含答案的确切时间段(也就是人工打了时间标记的那部分),看看在完美定位的情况下AI能达到多高的分数。结果非常明显——在真正挑战集上,完美定位让Eagle2.5的得分从35%大幅跳升到50.8%;而在捷径题上,同样的完美定位带来的提升却很小,从78%只升到80.8%。这证明了一个重要结论:精准的时间定位对于真正需要视频理解的问题来说至关重要,但对于捷径题意义不大,因为那些题本来就不需要找特定的时间段。换句话说,捷径题“随便定位也能对”,但真正的挑战题“差一秒都可能答错”。

第二个实验探讨的是“思考深度的灵活性”。当前一些顶尖AI模型具有两种工作模式:一种是快速回答模式,直接给出答案;另一种是深度思考模式,会先在内部进行大量的推理再给出答案。研究团队对比了Qwen3-VL在快速模式(33.8分)、深度思考模式(34.6分)以及一种自适应切换模式VideoAuto-R1(36.8分)下的表现。

自适应切换模式的意思是:AI会根据问题的难度自己决定“要不要深入思考”,而不是对所有问题都用同一深度的思考。结果显示,这种灵活切换的方式比固定用深度思考的方式表现更好,说明并不是“越深入思考就越好”,而是要“用对地方”。

更有趣的是,研究团队做了一个理想化实验:如果AI每道题都能在“快速模式”和“深度思考模式”之中选择更好的那个答案,得分会是多少?答案是46.2分,几乎和当前最强的Gemini-2.5-Pro(46.7分)持平。这意味着,仅仅通过更聪明地决定“什么时候该认真想想,什么时候直接回答”,一个8B参数的小模型就能比肩目前最顶级的商业闭源大模型——这一发现揭示了一个巨大的优化空间,而且这个优化不需要更大的模型,只需要更聪明的“思考策略”。

第三个实验比较了两种主流训练方式的优劣。一种是“监督微调”,也就是给AI喂大量标准答案让它学习,这就像传统的填鸭式教育;另一种是“强化学习”,让AI通过不断尝试和获得反馈来自我改进,更像是通过实战练习来提高。以Qwen2.5-VL为基础模型,监督微调训练出的Eagle2.5拿到了34.5分,而只用基本问答奖励训练的Video-R1只拿到26.3分,甚至比未经训练的基础模型(29.2分)还要差。这说明强化学习的效果好不好,关键取决于奖励机制怎么设计。而加入了“时间定位”专项奖励的VideoAuto-R1达到了32.7分,介于两者之间,同时在全局叙事理解这个最难的维度上表现特别突出,从21.2%大幅提升到28.6%。

这组对比揭示了一个微妙但重要的结论:监督微调和强化学习并不是非此即彼的竞争关系,而是各有擅长的互补关系。精心设计的长上下文监督微调能显著提升整体的时空推理能力,而带有定位奖励的强化学习则对提升需要整合长段视频信息的全局叙事理解特别有效。

五、这套工具本身是否可靠

面对一套新的诊断工具,自然会有一个合理的疑问:Video-Oasis判定的“捷径题”,真的是AI能绕过视频理解来答的题吗?还是说,它错误地把一些“恰好比较简单但仍需视觉理解”的题归入了捷径?

研究团队对此进行了专门的验证。他们用和诊断时不同的AI模型(InternVL-3.5、LongViLA-R1、STAR)对被判定为捷径的题目进行标准模式下的重新测试,发现这些题目的平均正确率高达76%,远高于随机猜测的25.6%。这说明捷径题确实是AI用正常方式也很容易答对的题,Video-Oasis的判断是有效的。

此外,研究团队还验证了Video-Oasis筛出的真正挑战集是否仅仅是“难题集”。他们找出了让三个顶尖模型全部答错的题目(共6609道),和Video-Oasis筛出的挑战集做对比,发现两者只有44.6%的重叠。这意味着Video-Oasis并不只是在挑“难题”,而是在用视觉依赖性和时间依赖性这两个专属于视频理解的维度来筛选,这和单纯的“难度筛选”是不同的标准,也更有针对性。

为了保证诊断结果不依赖于特定模型的偏好,研究团队还用多种不同的模型组合重复了整个诊断过程,发现不同模型组合得出的捷径集重叠度均超过87%,说明Video-Oasis的判断结论具有较强的稳健性,不因选用哪几个模型而发生根本性变化。

六、审查过程中还发现了什么意外收获

在整个审查过程中,研究团队的人工核查环节发现了一些有趣的边界案例,值得单独说一说。

有一类案例是“被错误筛出的时间题”。某些题目在打乱帧顺序后AI仍然答对,按照自动化的诊断逻辑这应该算捷径题,但人工审查后发现这些题其实需要时间顺序,比如“棒球裁判投出第二球之后做了什么”——“第二球之后”这个时序关系显然要求视频是按顺序播放的,AI答对可能只是碰巧,并不代表这题不需要时间理解。这类题被人工从捷径集中移回了挑战集。

另一类案例是真正的标注错误。比如有道题问“视频中‘person fixes their hair’这个动作发生在什么时候”,标注的答案是“贯穿整段视频”,但实际上这个动作只出现在视频中段。还有些题目里用到了“棕色头发的男人”这个指代,但画面里实际上有多个棕色头发的男人,根本无法确定是哪一个——这类歧义导致这道题从任何角度都无法可靠地给出正确答案,属于标注质量问题。这些案例被彻底从测试集中剔除,避免污染评估结果。

这些发现说明,视频数据的复杂性使得标注工作本身就比图片或文本标注难得多,当前许多测试集在标注质量上存在不可忽视的隐患,而Video-Oasis的人工核查环节正是专门用来捕捉这类问题的。

说到底,这项研究的核心贡献并不是提出了一个更难的视频测试题库,而是提供了一面照妖镜,专门用来照出“视频AI是否真的理解视频”这个问题的真实答案。过去我们以为AI在视频测试上拿到高分意味着它真的学会了看视频,但这面镜子告诉我们:高分背后很可能藏着大量可以绕路走的捷径,真正需要理解时间和空间的问题,当前最好的AI系统也只比瞎猜强一点点。

这对普通用户意味着什么?如果你正在考虑使用某个视频理解AI工具,光看它在基准测试上的得分是不够的,因为那些分数可能被虚高了。Video-Oasis这套工具是完全开源的,任何人都可以拿来检验自己感兴趣的AI系统在去掉捷径之后的真实水平。

对整个AI研究领域而言,这项研究指出了一个清晰的努力方向:下一代视频AI需要真正掌握时间信息,能精准定位视频中与问题相关的关键片段,还要学会根据问题难度灵活调整自己的思考深度。强化学习的奖励机制设计和长上下文监督训练的结合,则是目前最有潜力的技术路径。

如果这些问题让你对视频AI的现状和未来产生了兴趣,不妨思考这样一个问题:在你日常生活中使用过的视频相关AI功能里,哪些可能只是“看起来很懂视频”,哪些才是真正在理解视频内容?这个问题的答案,可能比你预想的更复杂。感兴趣的读者可以通过arXiv:2603.29616查阅完整原文,深入了解研究团队的所有实验细节和数据。

Q&A

Q1:Video-Oasis是用来做什么的?

A:Video-Oasis是由韩国世宗大学与NA VER Cloud开发的一套视频AI评估诊断工具,专门用来检测现有视频理解测试集里是否存在“捷径题”,也就是那些不需要真正理解视频就能答对的题目。通过三类检查(视觉依赖、时间依赖、注释质量),它能把测试集里的“注水题”过滤掉,只保留真正需要视频理解能力才能作答的题目。

Q2:为什么视频AI在基准测试上得高分,但实际能力却很有限?

A:因为现有的视频测试集里大约有55%的题目存在捷径,AI可以靠常识猜测、音频内容或静止图片来答对这些题,根本不需要理解视频的时间动态。这导致测试分数虚高,掩盖了AI在真正时空理解上的短板。Video-Oasis去掉这些捷径题后,连最强的Gemini-2.5-Pro总分也只有46.7分,大多数开源模型只比随机猜测略高。

Q3:什么样的训练方式能提升视频AI的真正理解能力?

A:研究发现监督微调和强化学习各有优势,结合使用效果更好。加入时间定位专项奖励的强化学习对提升全局叙事理解特别有效,而精心设计的长上下文监督微调能提升整体时空推理表现。此外,让AI灵活决定“什么时候深入思考”比固定使用深度思考模式效果更好,这一策略让小模型的得分接近顶级商业大模型的水平。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。