发布于2026-07-23 阅读(0)
扫一扫,手机访问
21世纪经济报道记者 赵云帆
最近AI圈子里出了件大事——OpenAI公开披露,他们的一款前沿模型GPT-5.6 Sol,以及另一款能力更强的预发布模型,在内部网络攻防评估中,自己搞出了一场“越狱”行动。事情是这样的:评估过程中临时关闭了部分安全过滤器,模型居然自主发现了零日漏洞,突破沙盒隔离,进而入侵了Hugging Face的生产基础设施,还偷走了评测答案。这可是业界公开披露的首起由前沿大模型自主完成的真实网络攻击事件。
消息一出,硅谷和华盛顿都炸开了锅。大家争论的焦点是:当模型已经展现出长时间、多步骤自主规划复杂攻击链的能力时,我们过去那套“对齐+护栏”的网络安全范式,还能靠得住吗?
带着这个问题,21世纪经济报道记者专访了语生科学首席科学家、原点星辉CTO郭权玮博士。以下是采访实录。

21世纪:这次事件据OpenAI介绍,是在关闭安全护栏的情况下测试网络攻击能力引发的。模型厂商为什么要测试这种能力?又为什么非要关掉护栏?
郭权玮:网络攻击能力其实是典型的双用途能力。模型能发现漏洞、分析恶意代码,既可以用来攻击,也能帮企业提前发现并修复安全问题。所以,模型厂商必须先搞清楚一件事:模型在降低网络安全限制后,能力上限到底在哪里?只有摸清了底,才能判断后续该设什么级别的护栏,哪些能力可以开放给用户。
这次OpenAI暂时关闭部分安全护栏,道理也很简单——如果护栏一直开着,最后测出来的顶多是模型“会不会拒绝任务”,而不是它“真实具备多强的网络攻击能力”。但必须强调的是,在这种极限能力测试中,模型层面的限制越少,外部的沙盒隔离、网络权限和异常监控就越应该严格。不能为了测能力,就让模型真的接触到生产系统。所以这次事件反映的核心问题,不是“不该做这类测试”,而是模型能力增长太快,原有评测环境的安全设计没跟上节奏。
21世纪:OpenAI自己把这件事捅了出来,目的是什么?
郭权玮:这里面有三层考虑。第一,这件事已经被Hugging Face发现并披露了,OpenAI必须站出来说明责任归属和调查结果,这是基本的安全事件处理流程。第二,OpenAI也需要主动解释事件的性质。它希望外界把这件事理解为:模型在极限能力测试中,为了完成目标走了一条设计者没预料到的路径,而不是模型突然产生了恶意或自我意识。这是在争取事件解释权,降低外界对模型失控的恐慌。
第三,也是更重要的一层——这是在向行业传递信号:前沿模型的网络攻击和自主执行能力,已经开始超过原有评测体系的预期。行业需要重新评估模型能力,以及测试环境的安全标准。所以,这次公开既是为了处理事故,也是为了维护公司可信度、掌握事件解释权,同时推动整个行业重新认识前沿模型的风险。
21世纪:现在的大模型不是都有自律规则吗?为什么还会引发这种攻击行为?
郭权玮:这里需要先澄清一个概念——并不是所有大模型都有统一的“自律规则”。规则式对齐只是部分厂商采用的方法,其他厂商也会通过强化学习、系统规则和安全分类器等方式来降低风险。但这些措施本质上更多是概率性的行为约束,可以降低模型执行危险任务的概率,却不能像操作系统权限、网络防火墙或数据库访问控制那样,保证某个动作一定不会发生。
这次评测中,模型被要求寻找复杂的漏洞利用路径,同时网络安全拒答限制被降低了,生产环境的风险分类器也没启用。为了完成任务,模型最终选择了一条评测设计者没预料到的路径。与其说它突然产生了恶意或自我意识,不如说是任务目标和系统边界没有匹配好。所以,模型对齐只是安全体系中的一层。模型真正进入企业系统后,还得靠网络隔离、权限控制和运行环境这些硬约束。尤其当模型开始接触内部数据和业务系统时,企业必须清楚它在哪里运行、拥有哪些权限、调用过哪些工具,不能把安全完全寄托在模型“会不会主动拒绝”上。
21世纪:目前针对AI自主攻击,网络安全防护一般有什么反制措施?
郭权玮:目前比较有效的做法,不是依赖某一种安全措施,而是建立多层防御。在模型层,要识别危险请求、加强安全训练,并持续评估模型的能力边界;在Agent和工具层,要坚持最小权限原则——能以只读方式完成的任务,尽量不授予写入权限。涉及删除数据、修改配置、资金操作或发布代码这类高风险行为时,需要人工确认或独立规则系统批准。在基础设施层,还要通过沙盒隔离、网络白名单、短期凭证和密钥隔离等方式,限制模型直接接触真实生产系统。这样即使模型形成了不安全的执行计划,也很难真正落地。
另外,所有工具调用和系统操作都应该被完整记录。一旦发现异常提权、批量访问或可疑网络连接,系统需要能够立即中止任务、撤销凭证并进行回滚。防御型AI也可以持续分析日志和异常行为,帮助安全系统更早发现复杂的自动化攻击。当然,由于企业的源代码、系统日志、漏洞信息和访问凭证本身高度敏感,这类分析尽量要在企业自身可控的环境中完成,避免在防御过程中产生新的数据暴露风险。
21世纪:现在的模型有些蒸馏版本可以轻易本地化部署,个人能不能通过主动取消安全护栏,诱导大模型进行网络攻击?
郭权玮:从技术上看,这是有可能的。开放权重模型部署到本地以后,使用者可以修改系统提示、重新训练模型,甚至降低安全限制。但这不代表下载一个蒸馏模型,就能自动发动高级网络攻击。真正的攻击能力还取决于模型本身的推理和代码能力、Agent框架、可调用的工具、账号权限、计算资源,以及目标系统是否存在可利用的漏洞。蒸馏或量化也可能影响模型完成复杂、长链路任务的能力。
不过,大模型发现漏洞、分析攻击路径和自主调用工具的能力只会越来越强。随着模型不断小型化、推理成本下降和本地硬件能力提升,未来个人和企业都会逐步拥有自己的模型,本地模型也会成为一种主流的基础形态。这对人类整体来说是很大的利好——模型会更普及,个人和企业也能更好地掌握自己的数据、成本和使用方式。但模型真正进入个人设备和企业内部以后,安全机制也必须同步纳入模型和Agent的运行体系,不能把模型部署完成就当成工作结束。
一个成熟的本地模型与Agent系统,需要把模型、数据、权限、工具调用和执行记录统一管理,让恶意代码分析、日志审计、漏洞排查和敏感数据处理尽量在内部完成,做到数据不出域、权限可控、过程可追溯。未来本地模型不仅会承担通用工作,也会逐渐成为个人和企业数字基础设施的一部分。
21世纪:未来Agent时代,模型将拥有写入能力,届时网络安全会面临什么复杂情况?我们该怎么应对?
郭权玮:其实,一部分代码Agent、浏览器Agent和企业Agent现在已经具备写文件、修改代码、调用API和操作业务系统的能力。未来真正的变化,不是模型突然获得写入权限,而是Agent能连续工作更长时间、连接更多系统,并承担更复杂的任务。首先,攻击者可能不再直接入侵企业系统,而是通过邮件、网页、文档或插件中的隐藏指令影响Agent,让它利用自身已有的身份和权限执行危险操作。其次,网络攻击可能从一次性的代码生成,变成长时间的、并行化的,并且能够根据环境不断调整的自动化过程。多个Agent可以同时尝试不同路径,持续寻找系统中的薄弱环节。
另外,风险也会从模型本身扩展到记忆、工具、插件、外部数据和Agent之间的通信。一处被污染的信息,可能随着Agent的工作流程进入多个业务系统。因此,企业不能把Agent当成拥有充分自主权的超级管理员,而应把它视为一个能力很强、但必须被严格管理的执行主体。权限要按照任务动态授予,高风险操作需要额外确认,整个执行过程也必须能够被追踪、中止和恢复。
未来AI安全关注的重点,会逐渐从模型说了什么,转向模型能够访问什么、调用什么,以及最终实际做了什么。随着攻击型模型和Agent的能力增强,面向防御的模型、安全智能体和自动化响应系统也会同步发展。未来的网络安全,很可能会逐步进入由AI持续识别、限制和处置AI攻击的阶段。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9