发布于2026-07-29 阅读(0)
扫一扫,手机访问
这篇由马克斯·普朗克智能系统研究所(德国蒂宾根)、苏黎世联邦理工学院、ELLIS研究所及蒂宾根AI中心联合完成的研究,以预印本形式发布于2026年7月16日,论文编号为arXiv:2607.15277v1。对技术细节感兴趣的读者,可以直接通过这个编号去翻原论文。
你有没有想过一个很基础的问题:当我们问ChatGPT或Claude“美国人平均收入超过5万美元的概率是多少”时,它给出的答案,到底是基于它掌握的人口知识做出的可靠估计,还是随手一蒙?
德国和瑞士的这支研究团队决定认真追问这件事,结果发现了一些让人坐不住的东西。
先说个简单的。假设你想知道全班同学的平均身高,有两个办法:直接问老师“平均身高是多少”,或者先把学生按性别分成男女两组,分别问每组平均身高,再按人数比例加权合并。如果两种方法得到的结果一致,说明数据自洽;如果差距很大,那肯定哪里出了问题。
这个道理在数学上叫“全概率公式”,是概率论最基础的公理之一,就像1+1=2一样毋庸置疑。但研究团队想验证的是:当AI模型被要求估计某个统计量时,它对“整体”的直接估计,和对“各部分”的估计加权合并后的结果,会不会一致?
答案是:往往不一致,而且差距相当明显。
为了系统性地检验这个问题,团队设计了一套精巧的测试方案。用生活场景来理解:假设你要调查某城市居民的收入情况,可以直奔市政府问“有多少人年收入超过5万美元”,这是直接问整体;或者先把居民按年龄分成两组——工作年龄段(31-68岁)和非工作年龄段——分别调查两组收入,再按人口比例合并。如果数据真实可靠,两种方式应该得到相同答案。
研究团队把这个逻辑应用到了AI身上,并做得更系统化。他们构建了一种叫“二叉条件树”的结构,本质上就是一棵不断细分人群的分类树:根节点是整体人群(比如“美国所有居民”),第一层按年龄分成两组,第二层在每组内再按就业状态分组,第三层按每周工作时长……每深入一层,人群就被切割得更细碎。
他们使用的真实数据来自2024年美国社区调查(ACS),这是美国最权威的人口调查之一,涵盖380万受访者的收入、就业、年龄等详细信息。这份数据既用来构建分割方案,也作为检验AI答案准确性的“标准答案”。
在每个节点上,团队都会向AI提供该人群的文字描述,比如“一位居住在美国、年龄在31到68岁之间、目前受雇或自雇的人”,然后让AI估计该人群年收入超过某个门槛的概率。这种通过文字描述引导AI代入特定群体视角的方式,在AI研究领域叫“人物角色提示”。
收集完所有节点的AI估计值后,团队按照全概率公式,从底层节点往上逐层加权合并,重建出整体人群的估计概率,然后与AI对整体人群的直接估计值进行比较,同时也与真实的ACS数据进行比对。
测试结果揭示了一个令人惊讶的规律,研究团队给它起了个专门的名字:宏观谬误。简单说就是:当AI被要求直接估计整体人群的某个统计量时,它给出的答案往往比从更细分的子群体估计中加权合并得到的答案准确度更低。换句话说,你直接问“全国人怎样”,不如先问“年轻人怎样、中年人怎样、老年人怎样”,再把三个答案按比例拼起来——后者更接近真实情况。
这就好比侦探破案:与其笼统地猜“案子是怎么发生的”,不如逐一盘问每个证人,把每个人的陈述拼成完整案情。AI在面对宏观整体问题时,似乎会陷入某种模糊的“概括印象”,而被迫聚焦于具体子群体时,反而能调动更准确的知识。
这个规律在研究中得到了相当一致的验证。团队在不同收入门槛(从100美元到8万美元,跨越7个档位)、不同AI模型(包括GPT-5.4、GPT-4o mini、Claude Opus、Claude Sonnet、Gemini 3.1 Pro等顶级商用模型)、以及二叉树的不同深度上分别进行测试,结果几乎无一例外:重建后的聚合估计比直接估计更接近真实ACS数据,平均提升幅度相当可观。
不过,“越细越好”的趋势并非无限延伸。当树的层级变得很深、人群被切割得极为细碎时,改善效果开始下降,有时甚至反而变差。这引出了下一个问题:误差究竟来自哪里?
AI在估算加权合并值时需要两类输入:一是对每个子群体的概率估计,二是每个子群体在总人口中的比例(即权重,或称“先验概率”)。团队把这两类误差来源分别独立出来进行分析。
先看子群体的概率估计。当团队用ACS真实数据的人口比例替换AI自己估计的权重(即给AI一个“作弊码”,直接告诉它各组人口占比),然后让AI估计各子群体的概率,再用真实权重加权合并,结果发现:改善效果依然稳健。这说明“越细越准”这个规律,主要来源于AI对更具体子群体的条件概率估计确实更准确,而不仅仅是权重选择的问题。
背后的直觉是:当你问AI“一个普通美国人年收入超过5万美元的概率”,它需要在脑海中同时考虑各种各样的人——学生、退休者、全职工作者、失业者——并把所有差异压缩进一个数字。这种“一锅乱炖”容易让某些重要子群体的信息被稀释或遗忘。而专门问“一个31到68岁的在职美国人年收入超过5万美元的概率”,它能调用的知识更聚焦,答案也更精准。
再看权重的估计。当分组越来越细,AI需要同时估计的子群体数量呈指数级增长——二叉树每深入一层,节点数量就翻倍。研究发现,AI对越细碎的人口分组的比例估计误差越大(通过将AI的权重估计与ACS真实人口比例比较,用全变差距离量化衡量,结果确认AI在深层节点的人口比例估计准确性明显下滑)。
这就产生了一个两难困境:层级越深,子群体的条件概率估计越好,但权重估计越差。于是整体提升效果呈现出一条倒U形曲线——先升后降,在某个中间深度达到最佳平衡点。
从更抽象的统计角度看,这也可以用全方差定理来理解:对整体进行估计时,不确定性来自子群体内部和子群体之间的差异。分组降低了子群体内部的不确定性,让子群体之间的差异变得更加显性和可估计——这种“把异质性变得可见”的过程,正是分层估计优于整体估计的数学根源。
发现了分层估计的优势之后,研究团队自然会问:有没有办法不需要繁琐地构建整棵树,也能让AI“主动分层”思考?
于是他们设计了一种叫“微观到宏观提示”的方法。具体来说,就是在提问时加入一段额外指令,大意是:“在给出最终答案之前,请先考虑美国人口中可能在收入水平上存在差异的几个主要子群体,分别评估它们的人口比例和收入概率,然后综合这些子群体的情况给出总体估计。”
这个方法的关键在于,它不需要研究者预先指定具体分组方式,而是让模型自己决定如何分割人群,然后在一次对话中完成所有子群体评估和合并计算。
测试结果显示,这个轻量级的改进在大多数情况下确实有效。在ACS收入估计任务中,多数模型在采用“微观到宏观提示”后,比直接估计的绝对误差更小。在另一组使用全球意见调查数据集(GlobalOpinionQA)的测试中,也有一半以上的模型表现出了改善。
不过,这种方法的效果比直接构建分层树要弱,而且更依赖于具体模型的能力——有些模型从中受益明显,有些则效果不稳定。这说明“让模型自己想到要分层”与“强制要求模型按照特定分层来估计”之间,仍然存在系统性差距。
值得注意的是,这也排除了一种替代解释:也许分层方法之所以更好,仅仅是因为它花了更多的计算步骤?研究给出了否定的答案。“微观到宏观提示”同样需要额外的推理步骤,但效果不如显式分层树稳定;而且分层树在某个深度之后改善效果反而下降,尽管它调用了更多次模型。这些证据都表明,改善来自的不是“更多计算量”,而是“更结构化地暴露了子群体差异”。
发现了“宏观谬误”之后,研究团队进一步追问:AI的自相矛盾到底有多严重?为此,他们设计了两种系统化的一致性检验,这两种检验的共同特点是不需要任何外部的“标准答案”——它们完全依靠AI自身的输出来判断是否自洽。
第一种叫“分割一致性”。它检验的是:当AI估计一个整体的某个统计量,以及估计把这个整体按某种方式一分为二后两个子群体的同一统计量,这两种估计是否满足全概率公式?具体操作是对于每一个可能的“父节点-子节点对”,计算直接估计与加权合并估计之间的差距,如果差距超过一个容忍阈值(研究中设为0.02,即2个百分点),就判定为“不一致”。分割一致性分数就是通过检验的比例。
第二种叫“顺序一致性”。它检验的是:当AI被问及同一个子群体的统计量,但描述该群体的属性顺序不同,答案是否一致?比如,“一个年龄在31到68岁之间、且目前受雇的人”和“一个目前受雇、且年龄在31到68岁之间的人”,这两句话描述的是完全相同的群体,AI对同一个问题的答案应该相同。顺序一致性检验的就是这种对表述顺序的稳定性。
这两种检验覆盖了不同层面的自洽性:分割一致性测试概率构成的逻辑,顺序一致性测试表述方式的无关性。两者合在一起,构成了一套完整的“AI统计推理健康体检”。
研究团队在多个任务上系统性地运用了这套检验,包括ACS收入预测(四分类收入区间)、ACS通勤时间预测、世界价值观调查(涵盖加拿大和印度尼西亚两国的五类意见问题),以及两个完全虚构的预测场景——一个是费德勒对纳达尔的网球比赛(按球场类型和首盘结果分组),另一个是架空奇幻世界中角色对战的胜率预测(按白天/夜晚和风力条件分组)。
各项测试的结果汇聚成一幅令人担忧的图景。
在ACS收入预测的四分类版本中,被测试的四款顶级模型(GPT-5.4、Claude Sonnet 4.6、Grok 4.3、Qwen3.6 Plus)的分割一致性得分在0到0.33之间,远低于满分1.0。其中最令人意外的是Claude Sonnet 4.6和Grok 4.3的分割一致性得分为零——这意味着在所有被测的分割检验中,这两款模型没有一次通过一致性门槛。顺序一致性方面稍好一些,最高的是GPT-5.4达到满分1.0,但其他模型普遍在0.25到0.50之间。
在ACS通勤时间预测的版本中,即便使用同一批模型和同一套分组结构,只是把预测目标从收入换成了通勤时间,一致性得分就出现了显著变化。这说明一致性并不只是模型本身的固有属性,而是会因预测任务的不同而呈现不同面貌。
世界价值观调查的测试揭示了更普遍的失败模式。研究团队横跨两个国家、五个问题、八个模型进行了全面测试。结果显示,没有任何一个模型在所有问题和所有国家上都保持了一致性,甚至没有任何一个模型在超过一半的检验中通过了分割一致性。在印度尼西亚数据上,DeepSeek V-3.2模型的分割一致性平均得分只有0.23,而整体平均得分最高的Claude Sonnet 4.6也只达到了0.70(顺序一致性)和0.70(分割一致性)。
两个虚构预测场景的结果同样不乐观。网球预测中,没有任何模型通过了超过一半的分割一致性检验。奇幻战斗场景中,模型间的差异较大,从0分到满分都有,但这个场景特别说明了一点:即使在完全没有真实世界参照数据的情况下,一致性检验依然可以运行,因为它只依靠AI自身的内部逻辑。
更大范围的模型横向比较则揭示了一个结论性的发现:研究团队把测试扩展到了24款不同的模型,覆盖了GPT系列、Qwen系列、Gemini系列和Claude系列的多个版本,并参考了“人工分析智能指数”这个衡量模型综合能力的第三方基准。结果发现,在同一模型家族内,即便模型的综合能力分数大幅提升,分割一致性和顺序一致性的得分并没有随之系统性地提高。换句话说,AI模型变得更“聪明”,并不自动意味着它变得更“自洽”。统计自洽性是一个独立的、尚未被现有训练方法所针对性优化的能力维度。
回到最开始的问题:AI给出的统计估计,真的靠谱吗?
这项研究提供了一个清晰的答案:在相当程度上,并不靠谱——至少不能无条件地靠谱。更准确地说,AI对统计问题的回答,会因为你问问题的方式而产生系统性的差异,即便这些不同的方式在数学上是等价的。
这对很多看似合理的AI应用场景构成了挑战。比如,有研究者用AI来做“合成调查”——让AI模拟不同背景的人对调查问题的回答,以此代替或补充真实的人口调查。如果AI在宏观层面和微观层面的估计之间存在系统性偏差,那么基于这种合成调查的结论就可能存在根本性的方法论问题,不同的研究者选择不同的提问粒度,可能得到截然不同甚至互相矛盾的“结论”。
同理,在预测和预报场景中,如果两个分析师对同一个事件用不同的方式向AI提问——一个直接问整体概率,另一个先按条件情景分类再综合——他们可能得到系统性不同的答案。而这种差异并不是因为他们掌握了不同的信息,仅仅是因为提问方式不同。
研究团队还指出了一个重要的不对称性:对齐和自洽性是两个不同的概念,它们之间没有必然的包含关系。一个模型可以在整体层面上的估计与人类数据高度吻合,但它对子群体的估计却可能一塌糊涂;反之,一个模型可以内部逻辑非常自洽,但整体估计却与真实世界大相径庭。评估AI的统计推理能力,需要同时检验这两个维度,而现有的主流评测体系几乎只关注对齐,对自洽性的系统性评估几乎是空白的。
从这个角度看,这项研究实际上提出了一类新的AI评测基准——完全不需要真实世界的参考数据,只需要对AI自身的输出进行内部一致性检验,就能发现其统计推理能力的缺陷。这对于那些无法获取真实数据的领域(比如预测未来事件、评估假设情景)尤为有价值。
说到底,这项来自德国和瑞士联合研究团队的工作,就像是给AI做了一次“逻辑体检”。检查结果是:AI的逻辑内脏并不总是互相协调的。它可能知道“年轻人收入低”、“老年人收入低”、“中年人收入高”,但当你直接问它“平均下来美国人收入怎么样”,它给出的答案却未必能反映出这三个已知事实的合理加权——仿佛大脑的左手和右手并不总是知道彼此在做什么。
这不意味着AI毫无用处,恰恰相反,研究的另一面是非常积极的:AI确实储存了大量有用的子群体知识,而通过分层提问的方式,这些知识是可以被更有效地提取出来的。这就为如何更聪明地使用AI提供了实践指南:与其笼统地问大问题,不如先把问题分解成更小的、更具体的子问题,然后手动或引导AI把这些答案合并起来。
至于这个问题的根本解法——如何训练出真正满足概率自洽性的AI模型——则是未来研究需要认真解决的开放课题。有兴趣进一步探索这个方向的读者,可以通过arXiv编号2607.15277查阅完整论文,那里有更详尽的数学证明、实验设置和数据分析,以及对于如何把自洽性检验内化为训练目标的初步讨论。
Q1:什么是大语言模型中的“宏观谬误”(Macro Fallacy)?
A:宏观谬误指的是一种AI的系统性偏差现象:当直接询问AI对整体人群的统计估计(比如“美国人年收入超过5万美元的概率”),得到的答案往往比先询问各子群体的估计、再按人口比例加权合并得到的答案偏差更大。也就是说,“先细问再合并”比“直接粗问”更准确,体现出AI在处理整体层面问题时存在知识压缩的系统性失真。
Q2:全概率公式一致性检验是否需要真实数据才能进行?
A:不需要。研究中设计的“分割一致性”和“顺序一致性”两种检验都是参考免基准的,只需要比较AI自身在不同提问方式下的输出,不需要任何外部真实数据。这意味着即使在完全虚构的场景(如奇幻游戏战斗)中,只要能构建出逻辑上互斥且完整的分组,就可以运行一致性检验,用来发现AI内部逻辑的不自洽之处。
Q3:使用“微观到宏观提示”方法能否完全替代显式分层聚合?
A:不能完全替代,但在实际应用中是一种有价值的低成本替代方案。显式分层聚合(构建完整的二叉条件树)在改善准确率上更加稳定可靠,而“微观到宏观提示”仅通过在问题中加入引导语就能部分复现分层效果,但效果更依赖模型本身的能力,不同模型和不同任务上的改善幅度差异较大,有时甚至不如直接提问。