当前位置:

首页 > 硬件相关 > DeepMind报告:AI正在批量生产科学假设,但谁来证明它们是真的?

DeepMind报告:AI正在批量生产科学假设,但谁来证明它们是真的?

AI智能体可快速生成科学假设,如Co-Scientist两天提出与团队十年研究相符的假设,但无法独立验证。报告指出,假设生成加速而实验、评审等验证速度未同步,形成新瓶颈,需解决可及性、数据、设施及同行评审等问题。

一个科学家团队花了近十年才摸清的问题,AI 智能体只用了两天就给出了相同的答案——这事听起来多少有点科幻,但它确实发生了。

帝国理工学院的微生物学家 José Penadés 长期研究一个核心问题:某些“超级细菌”到底是怎么传播抗生素耐药性的?经过多年实验,团队逐渐确认,一些细菌会“偷”来病毒身上的尾部结构,把它们当作钥匙,从而进入不同的宿主物种。

这项研究当时还没发表。2024 年,Penadés 把一个简化版的研究问题交给了谷歌 DeepMind 开发的 AI 智能体 Co-Scientist。结果 48 小时内,Co-Scientist 给出了五种可能的解释,还按优先级排好了序。排名第一的那个假设,正是团队多年实验得出的结论。

Penadés 的第一反应不是惊喜,而是怀疑自己电脑被黑了。他赶紧联系谷歌,确认系统有没有读取过实验室的未公开数据。得到的回复是:没有。AI 没偷看答案。

更让人意外的是,Co-Scientist 提出的四个额外假设里,有一个方向是研究团队此前根本没考虑过的——目前正在被进一步验证。

Penadés 承认,如果研究一开始就有这样的工具,团队确实能少走很多年弯路。但必须警惕的是,即便 Co-Scientist 能在两天内提出正确假设,它也无法独立证明这个假设。真正让答案成为科学知识的,还是研究团队多年积累的实验数据。

最近,谷歌 DeepMind 发布了一份报告《Conjecture Machines: AI agents and the new validation bottleneck in science》,专门讨论了 AI 智能体如何改变科学研究。报告采访了多位内部研究人员和工程师,结合 Co-Scientist、AlphaEvolve 等案例指出:智能体正在加速假设生成和候选方案搜索,但实验、评审和结果理解的速度并没有同步跟上,“验证”因此可能成为科学研究的新瓶颈。

为什么 AI 智能体变好用了?

在聊这个瓶颈之前,报告先解释了一个现实问题:早期的 AI 智能体表现并不稳定,而科学研究偏偏对严密性和可靠性要求极高。那么,是什么让智能体在近一年内突然具备了参与真实科研工作的能力?

报告把答案归结为三个因素:基础模型变得更强,模型外部的“脚手架”逐渐成熟,智能体也更容易根据具体科研需求进行定制。


(来源:DeepMind)

首先,基础模型的推理能力大幅提升。报告提到,当前领先模型在 Humanity’s Last Exam、FrontierMath 等科学测试中的表现已经超过人类专家。比测试成绩更重要的是,模型不再急于给出答案,而是能进行多步推理,在不同方案之间探索、比较和修正。

这让智能体可以处理更复杂的问题,从大量论文中找出容易被忽略的信息,建立跨学科联系,并且判断什么时候需要搜索文献、运行代码或调用其他工具。

其次,智能体有了更成熟的“脚手架”。你可以把它理解为包裹在基础模型外面的一套工作系统,给模型增加了规划、记忆和使用工具的能力。借助这套系统,智能体可以检索论文、执行代码、使用科学软件,也能和其他智能体协作。

早期的脚手架往往只适用于特定模型或任务,模型升级后就得重新设计,也很难迁移到别的智能体系统上。但随着智能体之间通信、调用工具的标准逐渐形成,这类系统有望更容易复用,对定制化脚手架的依赖也会减少。

第三,智能体变得更容易定制。基础模型掌握了论文和教科书里的大量知识,但缺少科学家在长期实践中积累的经验——比如怎么培养特定细胞、处理实验异常,或者让复杂模拟顺利运行。

现在,研究人员可以把部分工作方法整理成“智能体技能”,用一组指令告诉智能体如何执行任务、调用哪些工具、产生什么结果。这些技能可以在团队内部共享和积累,实验室也可以在安全条件下,让智能体使用历史实验记录等内部资料。

在这种模式下,智能体并不是独立完成科学研究,而是承担文献整理、代码运行、数据分析和候选方案生成这些工作。科学家则负责设定目标、检查结果并做出判断。

计算生物学家 Natasha Latysheva 已经把自己研究流程中的部分方法整理成了智能体技能。她认为,尽管目前的 AI 智能体还不完全可靠,但科研人员的工作方式可能逐渐从亲自执行转向更高层次的调度。“我们每天会先检查智能体在夜间完成的实验和分析,再调整研究方向,安排下一轮任务。”

AI 智能体正在怎样改变科学研究?

AI 智能体带来的直接变化,是成为科学家的数字助手。文献筛选、数据库查询、数据整理和代码编写这些任务,都可以部分交给智能体处理。谷歌 DeepMind 高级研究科学家 Matej Balog 认为,这能让研究人员完成一些过去受编程能力限制、难以独立完成的工作。

但报告更关注的是智能体对科研核心流程的影响——从构思、寻找最优解到验证,AI 正在不同程度上参与科学发现。

构思阶段,科学家通常并不缺少想法,真正难的是判断哪些方向值得投入时间和实验资源。智能体可以阅读大量公开文献,寻找分散在不同学科中的线索,然后让多个子智能体分别提出假设、相互批评和排序。

斯坦福大学的研究人员 Gary Peltz 曾使用 Co-Scientist 寻找可以被重新用于治疗肝纤维化的现有药物。根据文献和多年经验,Peltz 选了两个候选药物,Co-Scientist 则推荐了三个。

结果在人体肝细胞实验中,Peltz 选的两个药都没效果。AI 推荐的三个候选里,有两个不仅抑制了纤维化,还促进了肝细胞再生。

这无疑是个成功的案例。不过,智能体提出的假设并不一定都靠谱。Co-Scientist 负责人 Vivek Natarajan 提到,一份长篇分析中,即使只有一项关键内容由模型虚构,也可能让整个结论失效。他认为,科研智能体需要具备“认识论上的谦逊”——能够判断自己什么时候缺少信息,并明确表达不确定性,而不是只给出一个看似完整的答案。


(来源:DeepMind)

构思之后,智能体还可以在大量候选方案中寻找更优解。AlphaEvolve 的方法就是先生成多种候选算法,再按预设标准评分,保留表现好的结果,以此为基础继续迭代。据报告介绍,它已经被用于辅助设计谷歌下一代 TPU 芯片、处理数学中的 Erdős 问题,以及改进基因组数据分析。

“算法几乎可以描述这个世界上的大部分科学和自然过程,”Balog 表示。正因如此,当一个问题能够用代码表达、候选方案又可以被快速评分时,智能体就能在较少人工干预的情况下持续搜索。

但在材料、化学和生命科学中,计算得分较高的方案通常只是一条线索。一个由智能体设计的催化剂仍然需要被合成和测量,一种可能有效的药物也需要经过细胞、动物和临床实验。AI 可以加快候选方案的生成,却不能跳过现实验证。

数学和计算机科学在一定程度上是例外,因为部分验证可以在计算机里完成。DeepMind 开发的 Aletheia 把证明生成器与自然语言验证器结合起来:一个系统提出证明,另一个检查问题并把错误返回修改。今年 2 月的首届 First Proof 挑战中,Aletheia 在一周内解决了十道未公开研究问题中的六道,是所有参赛系统里成绩最好的。

但自动验证也带来了新问题。Aletheia 项目负责人 Thang Luong 将其称为“证明消化不良”:AI 产生数学结果的速度,可能超过人类专家阅读和审查的速度。

同样从事数学 AI 研究的 Alex Da vies 也在思考这场变革会把数学家推向何方。他说:“我可以想象这样一个世界:机器负责发现,而数学家要做的,是理解这些发现,并判断接下来哪些问题真正值得追问。”

从构思、搜索到验证,AI 智能体的作用逐步深入,但不同环节的进展并不一致。机器可以迅速增加假设和候选方案的数量,而实验设施、专家审查和自然过程却无法以同样的速度扩张。

科研体系如何应对验证瓶颈?

随着 AI 智能体能够快速生成假设和候选方案,科研体系也需要扩大筛选、验证和理解这些结果的能力。报告认为,政策制定者和科研资助机构需要重点处理四个问题:智能体的可及性、科研数据、实验设施,以及同行评审。

第一,让更多科学家能够使用先进智能体。报告将其类比为过去超级计算机的访问权——一个国家除了要考虑能不能训练出自己的前沿模型,还需要考虑能不能把智能体真正部署进大学和科研机构,以及实验室该怎么承担相应费用。

虽然单位 AI 能力的成本可能持续下降,但随着科研人员把越来越多、越来越复杂的任务交给智能体,实验室在模型调用上的总支出恐怕不会同步减少。报告因此建议,科研资助机构需要尽快判断:是在现有资助项目中增加预算,还是设立专门针对智能体使用的新资助渠道。同时,报告也建议简化采购流程,让研究人员可以按实际需要自主选择工具,而不必经过繁琐审批。

第二,智能体需要能读取真正适合机器使用的科研数据。目前,不少科研资料以网页、PDF 或下载文件的形式存在,虽然可以供人阅读,却缺少统一格式、清晰的元数据和稳定接口,很难被智能体持续调用。

报告建议,将开放或风险较低的公共数据整理为“智能体就绪”的数据资源,并加强质量控制、长期维护和跨平台兼容。对于医疗、基因组和病毒学等敏感数据,则需要设置权限管理、隐私保护和操作审计机制。报告以英国 OpenSAFELY 项目为例:研究人员可以在受控环境中分析医疗数据,而无需直接接触原始数据,未来类似的机制也可以延伸到智能体的数据访问上。

第三,扩大实验验证能力。许多研究人员目前已经在为仪器和实验设施的排期发愁,而当智能体持续产出新的候选假设,需要被验证的项目只会越积越多。

报告提出了两条路径:一是加大对现有公共实验设施的投入,把更多实验台位和仪器运行时间开放给外部研究团队;二是推动自动化实验室建设,用机器人和自动化仪器全天候运行标准化实验。

谷歌 DeepMind 已经在英国弗朗西斯·克里克研究所建立了一间湿实验室,并为部分使用 Co-Scientist 的独立研究人员提供实验经费;美国的 Genesis Mission 计划则试图打通能源部下属国家实验室、高校和 AI 企业之间的资源。由于自动化实验室的建设成本高昂,报告建议采用公共投资和共享设施的模式,降低单个团队使用这些资源的门槛。

第四,调整同行评审机制。AI 已经大幅降低了撰写论文和基金申请书的成本,这意味着投稿和申请数量还会继续攀升,而文字表达本身也越来越难以直接反映研究质量。学者 James Wilsdon 和 Geraint Rees 就指出,问题不只是供给量的增加,写作质量本身已经不再是一个可靠的筛选标准。如果申请人普遍借助智能体准备材料,而评审者仍完全依靠人工逐一审阅,现有的评审压力只会进一步加剧。

报告建议,评审者同样可以借助智能体检查引用是否准确、数据是否存在错误、证据链是否完整,从而把更多精力留给对研究价值本身的判断。不过,由于评审材料通常尚未公开,相关工具的使用也需要满足严格的保密和数据安全要求。

此外,研究人员还需要更清楚地说明 AI 在研究中的作用。报告提到了“人机交互卡”(Human-AI Interaction Cards)这一设想:记录下产生关键研究思路时所使用的提示词、模型输出和后续的人工修改,让评审者能够追溯一项成果究竟是如何形成的。

显然,智能体的普及会影响下一代科研人才的培养。但如果年轻研究人员在真正掌握基础方法之前,就已经习惯把大量工作外包给 AI,未来可能难以形成审视和质疑机器输出所需的专业判断力。报告因此建议,科研训练体系可以保留一定的无智能体阶段,让学生先扎实掌握基本方法,再逐步把智能体当作协作伙伴使用。

1.https://datumo.com/blog/insight/co-scientist-google-ai-en/
2.https://deepmind.google/public-policy/conjecture-machines-ai-agents-and-the-new-validation-bottleneck-in-science/

注:封面由 AI 辅助生成

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。