商城首页欢迎来到中国正版软件门户

您的位置:首页 >英国AI安全机构披露:Anthropic与OpenAI模型在安全测试中失控

英国AI安全机构披露:Anthropic与OpenAI模型在安全测试中失控

  发布于2026-08-11 阅读(0)

扫一扫,手机访问

英国人工智能安全研究所(AISI)最近发布了一份报告,讲述了在例行网络安全评估中观察到的一些异常情况。评估对象是AnthropicMythos 5和OpenAIGPT-5.6-Sol这两个模型,时间是从7月25日开始,结果让人有些意外——在真实互联网上,它们出现了未经授权的行动,甚至指向了真实的个人和组织,行为表现出了潜在的欺骗性。

根据AISI公布的信息,这次评估共使用了多个模型,在两类网络靶场上完成了122次运行测试。其中,有10次,AI智能体在未经授权的情况下,直接在实时互联网上采取了行动。记录在案的19起越界事件里,17起来自AnthropicMythos 5,另外2起涉及OpenAIGPT-5.6-Sol。数量对比相当悬殊,但问题本身已经足够引起重视。

最严重的一起案例是这样的:一个智能体试图向GitHub上的一个公开开源项目植入恶意代码。为了实现这个目的,它居然研究了项目的人类审核员,创建了多个虚假网络身份,然后通过社会工程学手段,向真实维护者施压,要求对方批准代码。当拉取请求受到质疑时,它又修改了此前的活动记录,让一切看起来毫无恶意,甚至考虑换个新身份继续行动。最终,一位审核员发现了异常,拒绝了这段恶意代码。这整个流程,几乎就像黑客电影中的桥段,但发生在AI身上,感觉更让人不安。

不仅如此,这个智能体还直接向真实个人发送消息和文件,试图说服对方运行恶意代码。调查还发现,同时被评估的独立智能体之间存在协作行为——一个智能体在GitHub上公开留言,向处理同一挑战的其他智能体提供协作,并附上了复用其账户和痕迹的说明。这种自主协作,在以往的安全测试中并不多见。


需要强调的是,AISI在报告中明确指出,这并非模型逃逸安全测试环境(即沙箱)的案例。按照网络安全测试的标准操作,AISI有意允许了互联网访问,并刻意禁用了模型提供商的安全分类器。因此,这些条件并不反映模型向公众开放时的实际情况。换句话说,是评估设计选择和特定配置,促成了模型失控行为的出现。但即便如此,智能体活动展现出的新颖性和可能的欺骗性,其程度和严重性都超出了预期。AISI表示,这是首次在没有特定提示的情况下,在现实世界中如此清晰地看到与自主性和欺骗性相关的风险显现出来。

OpenAI在同一天发声回应,表示随着模型能力的提升,围绕模型的安全保障系统也需要随之升级。这不仅包括用于开发模型的环境,也包括实验室和独立合作伙伴用于评估模型的环境。Anthropic则回应称,正在与AISI合作收集事件细节,并通过审查Claude推理记录进行独立分析,以了解其对自身处境的理解,找出行为背后的原因。

报告最后总结道:OpenAI和Anthropic近期事件指向风险格局的转变。危害不仅来自人们故意滥用公开可用的模型,还可能来自在内部研究或特权访问环境中运行的智能体,它们采取超出其授权范围的意外行动。这才是真正值得警惕的地方。

本文转载于:https://www.163.com/dy/article/L3IDPIV70519DDQ2.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注