ScienceMetaBench 开源:科学文献元数据提取评测基准
上海人工智能实验室OpenDataLab团队推出ScienceMetaBench评测基准,用于评估科学文献元数据提取能力,覆盖论文、教科书和电子书三类文档,支持中英文双语,采用多源异构PDF及K-Means聚类增强样本多样性,标注流程结合大模型预标注与专家校验。
先说说最近评测界的一个新动向——上海人工智能实验室 OpenDataLab 团队正式推出了一个叫 ScienceMetaBench 的评测基准,专门用来评估科学文献元数据的提取能力。说白了,就是看看各种模型从PDF里扒拉标题、作者、摘要这些信息到底有多准。
这个基准的初衷很实在:给学术界和工业界一个公平、可复现的“标尺”,让大家能对不同的元数据提取方法做横向比较,而不是各说各话。毕竟,市面上类似的评测标准五花八门,打出来的分很难直接对等。
ScienceMetaBench 的评测对象覆盖了三类常见的科学文档:学术论文(Paper)、教科书(Textbook)和电子书(Ebook)。这还不够,团队还特意强化了对中英文双语场景的支持——从文本识别到字段解析再到语义对齐,都做了语种自适应,保证提取结果和原文语言保持一致。这一点对于处理中文文献居多的场景尤其关键。
下图展示了一个从学术论文PDF首页成功抽取元数据字段的实例,大家可以直观感受一下提取效果:

从论文首页需要准确提取的核心字段包括:文件级的唯一哈希值(SHA256)、国际数字对象标识符(DOI)、文献标题(保留原始大小写和标点)、作者列表(统一英文逗号分隔)、关键词集合、完整摘要文本、以及标准化出版年份(仅四位数)。这些字段看似基础,但实际从不同排版、不同语言的PDF中精准抓取出来,挑战不小。
为了增强样本的多样性和现实鲁棒性,研究团队采用了多源异构PDF数据采集策略,还引入了K-Means图像聚类方法对页面布局进行无监督分组。这样一来,从紧凑的单栏到复杂的多栏,再到含有图表、公式、多语言混排的“硬骨头”案例,都能在评测中得到有效覆盖。标注流程采用的是“大模型预标注 + 领域专家人工校验”的协同模式,并且严格对标了已有的权威基准OmniDocBench,确保规范性和评测维度的前沿性。
总的来说,这个基准的出现为元数据提取领域提供了一个更规范的参考标准,后续大家可以基于它做更细致的性能优化和横向对比。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















