北京科研团队取得通用人工智能逻辑推理新突破
北京通用人工智能研究院联合北大团队开发的通矩模型,能自主出题与解题,突破几何推理瓶颈。通过规范化表示压缩搜索空间,并引入基于数学美学的价值评估机制,实现从被动解题到主动创题的范式跃迁。
当全球AI竞赛还在大语言模型和图像生成上卷生卷死时,中国团队悄然在另一个基础性领域——几何逻辑推理,埋下了一颗重磅冲击波。近日,由北京通用人工智能研究院领衔,联合北大多个学院组成的跨学科团队,成功开发了一款名为“通矩模型”(TongGeometry)的自主AI系统。相关成果已经登上了国际顶刊《自然-机器智能》。业内共识是:这是全球首个真正意义上既能“自己出题”又能“自己解题”的通用AI,标志着我们在自动化逻辑推理这个硬核赛道上,实现了从追赶到并跑甚至领跑的关键跨越。

简单来说,过去AI做几何题,一直卡在两个瓶颈上。
第一个是“组合爆炸”。 几何证明不像算术,它需要添加辅助线、辅助圆,每多加一个元素,可能的组合方式就呈指数级增长。搜索空间大到离谱,传统方法很容易在里面绕晕。
第二个是“数据饥渴”。 高质量的几何题库就那么点,题型有限,覆盖不全。靠这点数据去训练一个大模型,很难指望它泛化出多强的推理能力,更别提举一反三了。
为了解决这些问题,团队设计了一套高鲁棒性的逻辑推理搜索框架。这个框架不简单,它把复杂的几何世界做了一次彻底的“结构化拆解”。其核心思路是:让AI在每个推理节点上,都能像人类数学家一样,进行有层次、有策略的探索。这样一来,大量低效甚至无效的盲目试错就被有效地规避了。
这里面最让我眼前一亮的,是团队原创的“规范化表示”技术。你可以把它理解为赋予模型一种“看穿表象”的能力。在几何世界里,同一个命题,图形旋转90度、镜像翻转一下或者比例缩放一点,看起来就是千变万化的。但通矩模型能自动识别并归并所有对称等价或拓扑同构的构型。好比不管一个三角形怎么在坐标系里转,系统都能稳稳地抓住那个不变的核心几何关系。正是通过对这种几何对称性与不变量的深度建模,系统把原始的搜索空间压缩了几个数量级。这才是效率提升的关键支点。
有意思的是,它在激发解题直觉时,还引入了一套基于数学美学的价值评估机制。这听起来有点玄乎,但原理很实在:系统内置了个“价值模型”,依托强化学习框架,实时评估每条推理路径的价值。它关注的不仅仅是结论对不对,更在意推导链条是不是精炼、结构是不是优美、步骤是不是经济。
论文第一作者张驰在解读时打了个比方,说当模型察觉到某个命题的证明难度远超其构造本身时,它就会触发类似人类数学家“灵光一现”的信号。这种由价值函数驱动的主动探索,让系统不仅能复现已有的解法,还能从海量可能中甄别出符合人类数学审美的新题。用张驰的话说,这真正实现了从“被动解题”到“主动创题”的范式跃迁——而在这方面,全球范围看,这确实是首例。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















