商城首页欢迎来到中国正版软件门户

您的位置:首页 >南洋理工大学推出Apple-π

南洋理工大学推出Apple-π

  发布于2026-07-31 阅读(0)

扫一扫,手机访问

这项由新加坡南洋理工大学S-Lab与香港中文大学联合开展的研究,以预印本形式于2026年7月17日发布在arXiv平台,论文编号为arXiv:2507.16401。有兴趣深入了解的读者可通过该编号检索完整论文。

**一道关于苹果落地的问题,难倒了当今最先进的AI视频模型**

亚里士多德看到苹果从树上掉落,会说:"这是苹果回归大地的天性。"听起来很有道理,但完全没法用来预测苹果明天、后天或一秒钟后在哪里。牛顿看到同一颗苹果,却抽出一张纸,写下了 v = gt,然后用这个短短的公式推算出了月球绕地运行的轨道。两个人都"看懂"了苹果落地,但只有牛顿真正"理解"了背后的规律。

今天的AI视频模型,更像谁?

这正是南洋理工大学研究团队想搞清楚的核心问题。他们创建了一个名为Apple-π(读作"苹果派")的测评体系,专门用来检验视频模型究竟是在凭直觉"猜"物理现象的样子,还是真的掌握了物理定律并能用它推演未来的运动。结果令人深思:目前最好的视频模型,在这套考试里只拿到了0.473分(满分1分),而有些模型甚至不到0.2分。

这项研究不是为了挑剔AI的短板而存在。它的真正目标,是给未来的"世界模型"研究画出一张清晰的路线图——告诉开发者,AI在物理理解上具体卡在了哪一步。

**一、为什么现有的AI测评方式存在根本性缺陷**

在理解Apple-π的设计之前,有必要先聊聊一个长期被忽视的问题:我们过去评价视频AI的方式,其实只检查了答案,从来没检查解题过程。

假设你让一个学生做一道物理题,他交上来的答案确实是正确的,于是你给了满分。但你不知道,他其实是靠蒙的,或者在题目旁边见过类似的图,凭感觉写下了答案,完全没有理解背后的物理定律。如果下次题目稍微变一变,他就彻底不会做了。

现有的视频物理能力测评,几乎都处在这种"只看答案"的状态。研究团队梳理了市面上所有主要的相关评测,发现无论是面向文本生成视频的VideoPhy-2、PhyGenBench,还是面向图像生成视频的Physics-IQ,抑或是多领域综合评测的WorldModelBench,它们共同的局限在于:只评估模型最终输出的视频"看起来"是否符合物理直觉,而从不追问模型是否真正调用了物理定律来生成这段视频。

这产生了一个严重的盲区。视频模型在海量互联网视频上训练,见过无数次苹果落地、球体碰撞、斜面滑动,它完全有可能学会"苹果落地时应该越来越快"这个视觉模式,却对 h = 1/2 gt? 一无所知。一旦换一个不那么"常见"的场景——比如在月球上扔一个圆锥——模型就会露馅。

Apple-π的核心贡献,正是设计了一套能够追问"解题过程"的测评协议,将物理推理分解为三个可以独立检验的阶段,让我们第一次看清楚AI究竟在哪个环节出了问题。

**二、Orchard数据集:一片专门为考试准备的"物理苹果园"**

要考查物理推理能力,首先需要一批高质量的物理视频题目。研究团队为此建立了一个叫做Orchard(果园)的视频数据集,共包含400个精心设计的物理场景。

Orchard的构建原则与其他物理视频数据集有一个根本性的不同:它不是先找到各种物理视频、再给它们贴标签,而是先确定要考查的物理定律,再围绕这些定律专门制作或筛选视频。这就像出卷老师先定好考试大纲,再按大纲命题,而不是随机翻课本找题目。

视频来源分为三类。其中243个来自NVIDIA Isaac Sim物理仿真引擎,这类视频的好处是物理参数完全可知,每一帧物体的位置、速度、加速度都有精确记录,相当于"标准答案卷"。另有121个来自团队在实验室受控环境下自行拍摄的真实视频,在尽量隔离干扰因素的同时,引入了真实光照、材质等视觉细节。最后36个来自YouTube上的物理教育频道,用于覆盖前两类无法涉及的多样化场景。

为了保证评估的公平性,团队对所有视频中的运动物体做了统一规范:只允许出现球体、正方体、圆柱体和圆锥体这四种几何形状。这个看似"奇怪"的限制,其实有很深的考量——不规则形状或有语义含义的物体(比如一只猫)很容易让模型依赖"对这类物体的经验知识"而非物理定律来作答,就像考试作弊一样干扰评估结果。用纯几何体,相当于给所有选手穿上同款校服参加考试,排除了"认出题目"的干扰。

在内容上,Orchard覆盖了经典力学中的十个任务,按照主导物理定律组织成三大支柱。第一个支柱是万有引力定律,包含自由落体、抛体运动、斜面运动和弯道圆周运动,考查重力驱动下的各种轨迹。第二个支柱是动量守恒定律,包含完全弹性碰撞(碰后动能不损失)、完全非弹性碰撞(碰后合为一体)和部分非弹性碰撞(介于两者之间),这三种情况用恢复系数e来区分,e=1是完全弹性,e=0是完全非弹性。第三个支柱是牛顿第一定律,包含静止状态和匀速直线运动,考查在合外力为零时物体的行为。

此外还有第四个类别:多定律组合。这类场景会把两个或多个物理定律串联起来,比如一个物体先沿斜面滑下,再飞出去做抛体运动,最后撞上另一个物体发生碰撞。这种场景用来检验模型能不能把不同定律衔接起来使用,就像考试里的综合应用题。

每个场景都有详细的物理参数记录,以及经过三轮人工审核的标注信息。研究团队甚至为测量精度做了详细规范:物体质量精确到0.01克,尺寸精确到0.05毫米,初速度精确到0.05米/秒。两位标注员对关键字段的独立标注吻合度(Cohen's κ)普遍超过0.9,任务分类甚至达到了完美的1.0,说明数据质量极高。

**三、三段式推理协议:这场考试怎么考、考什么**

有了题目,还需要一套考试方式。Apple-π设计了一个三阶段的评测协议,对应科学推理的三个层次:感知(Perception)、建模(Formulation)和推演(Deduction)。这三个阶段形成一个递进的链条,就像侦探破案——先要看清现场(感知),再要判断嫌疑人用的什么作案手法(建模),最后还要根据手法推断出整个犯罪过程(推演)。

考试的输入方式颇具匠心。每道题都给模型提供一张"信息图式的第一帧"——也就是在原始视频第一帧上叠加了物理参数标注的图片,比如在球旁边标注质量"m = 1.0 kg",在旁边标注重力加速度"g = 9.8 m/s?",用箭头标出初速度方向。这样做是为了把"读懂物理参数"这件事从考题本身中剥离出去,让模型可以直接把精力用在推理上,而不是浪费在猜测"这个参数属于哪个物体"的歧义解析上。

模型的输出形式也统一为视频——无论被问哪种问题,模型都需要生成一段视频作为回答。这个设计来自"链式帧推理"的思路:视频的每一帧就像思维过程的每一步,生成视频相当于把推理过程"画"出来,让整个思维链条可见可查。

感知阶段分为两个子任务。第一个叫感知-文字,相当于考OCR能力:模型要把第一帧上标注的所有物理参数(数字、公式、箭头标注)原封不动地"重现"在一张纯白背景的图片上,保持位置、字体、颜色完全一致。第二个叫感知-图形,相当于考实例分割能力:模型要把与物理实验相关的物体(球、方块等)单独隔离出来,放在纯白背景上,去掉所有背景、地面和标注信息。这两个子任务合起来检验模型能不能正确识别出"这个场景里有什么物理量"和"这些量属于哪些物体"。

建模阶段同样分为两个子任务。第一个叫建模-文字,考查模型对物理定律的符号掌握:给出四个备选公式,模型要选出正确的那个,同时在纯白背景上写出三行文字——选项字母、正确公式的符号形式、以及把公式中的符号替换成具体数值后的结果。四个选项的设计很有讲究:一个是正确答案,一个是"迷惑选项"(与正确公式共用相同符号但不是正确定律),一个是"无关选项"(来自完全不同的力学分支),还有一个是"捏造选项"(看起来像物理公式但实际上不存在)。这样的设计让研究者能区分模型是真的选对了,还是只是因为"公式里有这些字母"就瞎选。第二个叫建模-图形,要求模型预测场景在某个特定时刻t*的状态——把每个物体画在它该出现的位置,并且用橙色箭头标出每个物体的瞬时速度方向,旁边附上速度数值。

推演阶段只有一个任务:给出带标注的第一帧,生成一段完整的视频,展示整个物理场景的动态演化过程,从头到尾都要符合物理定律的预测。这是三个阶段里难度最高的,因为它不仅要求某一个时刻的状态正确,而且要求整段运动轨迹在每一帧都保持物理一致性。

**四、打分体系:既有主观评委,也有客观仪器**

评分系统由两套机制组成。一套是基于大模型评委(MLLM Judge)的主观打分,另一套是基于物理定律的客观度量。两者结合,才能既评估"看起来好不好",也评估"物理上对不对"。

主观评分部分使用Gemini 3 Flash作为评委,针对不同子任务设计了对应的评分细则。以感知-文字为例,评委会检查18个维度,包括文字字体是否匹配、颜色是否一致、位置是否正确、内容有没有错别字或幻觉、背景是否干净的白色等等。以建模-文字为例,评委会检查选项是否选对、公式符号是否正确书写、数值替换是否准确、三行格式是否完整等11个维度。这些维度被分组聚合,每个子任务最终得到一个0到1之间的分数。

客观度量部分则直接用数学公式对比模型输出和物理预测的"标准答案"。对于感知-图形和建模-图形,用的是分割IoU——把模型输出的物体区域和真实物体区域做交集与并集的比值,越接近1说明位置越准确。对于推演任务,则用了更丰富的一组指标:归一化的PSNR(衡量像素级别的重建质量)、掩码PSNR(只在物体区域计算,避免背景干扰)、空间IoU(衡量运动发生的空间区域是否正确,不管时间)、时空IoU(同时考察运动在哪里和什么时候发生)、加权空间IoU(衡量运动发生的频率分布是否匹配),以及速度准确性(通过3D速度估计对比模型和物理定律预测的速度向量误差)。

这六个客观指标和MLLM主观评分按比例合并,其中物理准确性相关指标占60%权重,视觉质量占20%,帧完整性占20%。这个权重分配清楚地表明:在Apple-π眼里,"看起来好看"远不如"物理上对"重要。

为了验证评委打分的可靠性,研究团队还用开源模型Qwen3-VL-30B作为交叉验证评委,对七个代表性模型重新评分。两个评委的皮尔逊相关系数在整体平均分上达到0.95,在建模-文字和推演上甚至高达0.99,说明排名结论是稳健的,不依赖于特定评委模型的选择。

**五、大考放榜:11个模型的成绩单**

研究团队对11个代表性模型进行了全面评测,包括5个视频生成模型和6个统一理解-生成模型。每个模型在400道题、5个子任务、3次独立尝试上分别作答,总计6000次评估。

视频生成模型组包括:Wan2.2、HunyuanVideo-1.5、VBVR-Wan2.2、Seedance 2.0和Veo 3.1。统一理解-生成模型组包括:BAGEL、OmniGen2、SenseNova-U1-8B-MoT、SenseNova-U1-8B-MoT-Think、GPT Image 2和Nano Banana 2。

成绩最令人瞩目的差距,出现在视频生成模型和统一理解-生成模型之间。在视频生成模型里,Seedance 2.0是最好的,平均分0.473;Veo 3.1次之,0.313;VBVR-Wan2.2第三,0.373;而HunyuanVideo-1.5最低,只有0.177。相比之下,GPT Image 2拿到了0.704,Nano Banana 2拿到了0.699,比最好的视频模型高出将近50%。

这个差距说明了什么?关键不在于谁生成的视频更"好看",而在于统一理解-生成模型具备明确的视觉理解能力——它们不只是生成画面,而是先"看懂"再"画出来"。感知和建模阶段,GPT Image 2和Nano Banana 2的分数远高于任何视频生成模型,说明这类模型在读取物理参数、识别物体、选择定律方面更有优势。但值得注意的是,即便是这两个最强的模型,在推演阶段的得分也只在0.40左右——产生法律一致的时序运动,对所有模型来说都是最难的关卡。

VBVR-Wan2.2是个有趣的案例。它是在Wan2.2基础上用视频推理数据集进行微调的版本,在感知-文字上拿到了0.923的超高分(仅次于GPT Image 2的0.921和Nano Banana 2的0.934),在感知-图形上也表现不错。这说明针对推理能力的专项训练,可以显著提升模型"读标注、找物体"这类接口技能。但VBVR-Wan2.2在建模-文字上只有0.001,在推演上也只有0.201,说明读懂题目和真正理解物理定律是两件完全不同的事,前者的提升没有自动迁移到后者。

**六、逐阶段诊断:AI究竟在哪里摔跤**

Apple-π三阶段设计的最大价值,是能够精确定位模型在推理链条的哪个环节出了问题,而不是只知道它"答错了"。

从整体趋势看,感知最容易,建模居中,推演最难。这个梯度在所有视频模型上都很一致。感知-文字平均分在视频模型里是0.561,感知-图形是0.380,建模-文字骤降到0.168,建模-图形是0.283,推演是0.196。越往后,分数越低。

在感知阶段内部,感知-文字比感知-图形容易。读取标注文字(相当于OCR)比把物体从背景中分离出来(相当于目标检测)要简单。这符合直觉——识别数字和符号,模型见过大量训练样例;但精确勾勒出几何体的轮廓并完全去掉背景,在技术上更有挑战性。

建模阶段的两个子任务揭示了一个微妙的"选公式和用公式"之间的鸿沟。一个模型可以选出正确的公式(建模-文字),但在预测物体在特定时刻应该在哪个位置的时候(建模-图形)却不准确。这说明"知道用哪个公式"和"真的能用公式算出结果并把结果画到正确位置"是两种不同的能力。

推演阶段的挑战最为深刻。即便模型在前两个阶段都表现不错,在推演上依然可能失手。因为推演要求模型不只是对某一个时刻做出正确预测,而是要在整段视频的每一帧都保持与物理定律一致——物体要有正确的加速度、碰撞要产生正确的速度变化、圆周运动要保持正确的轨迹曲率。视觉上流畅的视频完全可以在物理上是错的,两者并不等价。

定性分析进一步揭示了一类常见的失败模式:标注语义绑定失败。模型可以正确地把标注文字显示出来(OCR成功),也可以正确地把物体轮廓分离出来(分割成功),但却把一个标注的含义——比如初速度箭头的方向——理解错了。结果,物体从第一帧开始就往错误的方向运动,整个推演过程完全偏离正确轨迹。这揭示了一个深层问题:模型能"看到"标注,但不能理解标注所代表的物理含义。

另一类常见失败则更基础:模型根本没有正确执行格式要求,比如把标注文字模糊成无法辨认的状态,或者在应该显示纯白背景的地方混入了背景残影,或者完全没有在图上画出速度箭头。这些错误甚至还没到物理推理层面,就已经在"输出正确格式"这件事上失败了。

**七、跨定律和跨来源分析:两个额外的弱点**

除了纵向的三阶段分析,研究团队还做了两个横向的切割:按物理定律分类和按视频来源分类。

在物理定律层面,多定律组合场景(Multi)的分数普遍低于任何单一定律场景。以最好的视频模型平均分为例,万有引力相关任务得0.45,动量守恒相关任务得0.51,牛顿第一定律相关任务得0.49,而多定律组合只有0.39。这个下降不是因为多定律场景"更复杂"(虽然确实如此),更本质的原因在于:多定律场景需要把第一段物理过程的结果——物体的位置、速度方向、接触状态——作为第二段物理过程的初始条件。这个"状态转移"步骤对现有模型来说极具挑战性。模型可以分别处理斜面运动和抛体运动,但当斜面末端的速度需要成为抛体初始速度时,模型往往无法完成这个衔接。

在视频来源层面,所有模型在仿真视频上的得分都高于真实视频,产生了一个"仿真到真实的迁移差距"(Sim-to-Real gap)。视频生成模型平均在仿真上得0.310,在真实视频上只有0.224;统一理解-生成模型在仿真上得0.564,在真实上得0.508。这个差距的根源不在于两者的物理定律不同——重力在仿真里和现实里都是9.8米每秒平方——而在于真实视频引入了更复杂的光照、纹理、背景噪声,让模型在定位和追踪物体时更容易出错,进而影响物理推理的准确性。

这两个横向分析共同指向一个结论:现有视频模型在"法律串联"和"视觉泛化"这两个维度上都有明显短板,而这两个维度恰恰是真实世界物理理解所必须的。

**八、两个方案验证了协议设计的合理性**

为了确认考试方式本身不存在"泄题"或"刁难"的问题,研究团队做了两组对照实验。

第一组叫"文字参数替代"实验。把第一帧上的信息图式标注换成结构化文字(直接在提示词里写"m = 1.0 kg, h = 2.0 m, g = 9.8 m/s?"等),而不是叠加在图片上。结果,两种方式下模型的得分差异极小,各子任务的分差几乎都在±0.05以内。这说明Apple-π并不是靠"让模型读图标注"来人为增加难度,信息图式标注的作用只是把物理量和视觉物体关联起来,而不是作为物理推理的障碍。

第二组叫"精简提示词"实验。把详细的输出格式说明去掉,改用简短的任务描述。结果显示,精简提示词对图形类输出任务(感知-图形、建模-图形)的负面影响最大,说明详细提示词主要起到规范答案格式的作用。建模-文字反而在精简提示词下有所提升,因为公式选择这件事本身不需要复杂的格式规范。整体来说,精简提示词降低了平均分,但对推演任务几乎没有影响——推演的难点不在于格式,在于物理。

这两组实验共同证实了Apple-π的设计符合其初衷:它考查的是物理推理能力本身,而非标注读取或格式遵循的技巧。

**九、这场考试的结论与未来路线图**

说到底,Apple-π这场大考揭示了一个当前AI界普遍存在但很少被明确指出的问题:视频模型学到的物理知识,更多是"视觉模式"而非"物理定律"。它们知道苹果落地时应该越来越快,但不知道为什么越来越快,更不知道如果初速度是3米每秒、高度是5米、重力加速度是9.8,那么0.8秒后苹果在哪里。

研究揭示的三个核心瓶颈相互关联:从感知到建模到推演的逐级衰减,意味着每个阶段的缺陷都会叠加到下一个阶段;多定律状态转移的弱点,意味着模型处理复合场景的能力远落后于处理单一场景的能力;仿真到真实的迁移差距,意味着即便是在物理上表现相对较好的模型,一旦换到真实世界的复杂视觉环境里就会显著退步。

统一理解-生成模型在感知和建模阶段的显著优势,给出了一个方向性的提示:把"先理解、后生成"的架构引入未来的视频世界模型,可能比单纯扩大视频生成模型的规模更有效。但即便是最好的统一理解-生成模型,在推演阶段也只拿到0.40左右,说明产生时序上连贯的、物理准确的视频动态,是目前整个领域共同面对的核心难题。

Apple-π数据集、评测协议和评分代码将公开发布,供研究社区使用。对于想深入了解每一个评测细节——包括完整的提示词模板、指标计算公式、数据标注流程的读者,原论文附录部分有详细的技术规范,可通过arXiv编号2507.16401找到完整版本。

物理规律统治了宇宙138亿年,让AI真正理解它们,看来还需要一些时间——但至少现在我们有了一把靠谱的尺子,知道距离终点还有多远。

Q&A

Q1:Apple-π基准测试是用来衡量什么的?

A:Apple-π是一套专门评估视频模型物理推理能力的测评体系,由新加坡南洋理工大学研究团队开发。它不只检查视频"看起来"是否符合物理直觉,而是将物理推理分解为感知、建模和推演三个阶段,分别检验模型能否读取物理参数、识别正确的物理定律以及生成符合该定律的完整运动轨迹,从而判断模型究竟是凭视觉经验"猜"出了结果,还是真正掌握了物理规律。

Q2:为什么视频生成模型在Apple-π上表现远不如统一理解-生成模型?

A:核心差距在于理解能力。视频生成模型主要从海量视频中学习"运动看起来像什么",更擅长模仿视觉模式;而统一理解-生成模型具备先"看懂"再"生成"的能力,在读取物理标注和选择正确定律上更有优势。不过,即便是最强的统一理解-生成模型GPT Image 2,在推演阶段(生成全程物理准确的视频)得分也只有约0.40,说明时序上的物理一致性是所有模型面临的共同难关。

Q3:Apple-π测试中所有模型在多定律组合场景上为何普遍失分?

A:多定律组合场景需要模型完成"状态转移"——把第一段物理过程结束时的位置、速度和方向,作为第二段物理过程的初始条件输入。比如物体沿斜面滑到底部后飞出做抛体运动,斜面末端的速度必须准确传递给抛体运动的初始条件。现有模型可以分别处理斜面运动或抛体运动,但跨越定律边界做状态衔接的能力明显不足,导致多定律场景得分(约0.30-0.39)普遍低于任何单一定律场景。

本文转载于:https://www.163.com/dy/article/L34B6PHG0511DTVV.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注