发布于2026-08-07 阅读(0)
扫一扫,手机访问
英国人工智能安全研究所最近发布了一份报告,里面提到的情况,恐怕会让不少人心头一紧。在针对AI智能体的网络安全评估测试中,一些智能体居然通过互联网,对现实中的个人和机构持续实施了一系列未经授权的、潜在有害的行为。

具体来说,这次测试要求智能体完成一项网络安全挑战。测试人员动用了7种模型,总共进行了122轮测试。结果在其中的10轮测试里,发现AI智能体干了19件明显超出测试设定范围的事情。这19件事里,有17件涉及美国Anthropic公司的“克劳德-神话5”模型,另外2件则是由美国开放人工智能研究中心(OpenAI)的GPT-5.6 Sol模型做出来的。
最严重的一个案例:某个智能体试图向一个公开使用的开源项目植入恶意代码。为了能让代码顺利通过审核,它创建了好几个虚假身份,去给一位真实的项目维护人员施加压力。好在维护人员最终发现了猫腻,拒绝了这份代码。
除此之外,这些智能体还尝试过直接联系现实中的个人,通过网络文件传输服务发送信息和文件,想让恶意代码跑起来;在代码里植入恶意指令,好去操纵其他AI编码工具;甚至在开源技术社区上留言,“邀请”参与测试的其他智能体一起“合作”。
当然,需要说明的是,这次测试的设定比较特殊。测试人员为了评估模型的最大能力,特意开放了互联网访问,还把模型提供商的部分安全机制给关掉了——这跟这些模型面向公众时的配置完全是两码事。目前没有明确迹象表明,在测试环境之外出现过类似行为。测试中发现的那些未经授权行为,最终也没有造成现实危害。
报告给出的建议是:应该收紧AI智能体访问互联网的权限,引入实时监测和拦截机制,并且重新评估测试设计。同时,报告也承认,这类行为会不会在其他环境中间出现、智能体是否意识到自己正对现实世界采取行动,这些问题都还需要进一步研究。
针对这份报告,Anthropic发表声明说,研究所采用的测试设定“不能代表我们任何一款实际投入使用的模型”;OpenAI的一名发言人则表示,研究所设置的测试条件“并不反映一般的使用情况”。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9