商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 中大郑子彬:推动智能体评测体系落地,以可信评测赋能治理

中大郑子彬:推动智能体评测体系落地,以可信评测赋能治理

  发布于2026-05-22 阅读(0)

扫一扫,手机访问

如何应对智能体发展带来的安全性挑战?这已成为行业必须直面的核心议题。在近日一场以“如何共守智能体安全底线”为主题的“AI新治向”系列沙龙上,中山大学软件工程学院院长郑子彬教授从可信评测的角度,为智能体安全发展提供了一把关键标尺。他指出,当前智能体安全问题日益凸显,而监管技术发展相对滞后,亟须搭建标准化、可落地的评测体系,以技术赋能监管,推动产业走向安全、可信、可控的发展轨道。


中山大学软件工程学院院长、教授郑子彬作主题分享。

技术剖析智能体三大安全风险

回顾过去十年,Gartner发布的十大科技趋势预测中,AI关键词的演变路径清晰可见:从“人工智能”到“生成式AI”,再发展到“智能体”及“多智能体”。2026年,行业正式进入智能体爆发阶段,其市场规模快速增长,并已成为消耗计算资源(Token)的核心主体。

智能体与大模型之间是怎样的关系?郑子彬将其比喻为“配合关系”——智能体充当大模型的“手脚”,能够调用各类应用软件并访问互联网以执行复杂任务,这恰恰弥补了大模型自身能力的局限。然而,这种强大的“行动力”也带来了更为严峻的安全挑战。具体而言,风险主要集中在三大方面:

首先是隐私泄露。在交互过程中,用户敏感信息被意外泄露的事件时有发生。其次是可靠性问题。大模型固有的“幻觉”特性,可能导致其输出答案与客观事实存在偏差,进而引发错误决策。最后,也是最值得警惕的,是行为风险。智能体容易出现自主越权操作、执行恶意指令、违规外联甚至造成物理危害等问题。

针对行为风险,郑子彬以当前热门的Skills工具为例进行了深入剖析。这些看似普通的技能文档,一旦被智能体加载,就会涉及工具调用、数据流向和权限边界等多个维度,潜藏着不容小觑的风险。他的团队曾对互联网上公开发布的10万余个智能体Skills进行检测,结果发现其中千余个存在访问越权、数据治理失控、恶意代码执行等多重安全隐患。这些风险对于普通用户而言难以甄别,极易导致设备失控、信息泄露等严重后果。例如,有的Skills会在后台窃取用户工作记录并发送至特定地址;有的则会将环境变量中的密钥隐藏于图片中秘密传出。

面对这些风险,全球范围内已开始行动。各国针对大模型及智能体相继出台了一系列法规政策,尝试从分级管理、风险评估等多方面探索治理路径。但郑子彬指出一个关键矛盾:监管技术的发展缺乏足够的经济激励,主要依赖宏观指引,落地效果有限;相反,大模型及智能体技术本身有着强劲的经济驱动,发展迅猛。“监管往往跟不上技术的发展速度。”他呼吁,监管部门有必要加大对相关监管技术研发的投入力度。

建议加强大模型及智能体可信能力评测

那么,如何弥合技术与监管之间的鸿沟?郑子彬认为,构建一套科学的可信能力评测体系至关重要。他的团队曾对8款主流智能体框架的可信能力进行评测,结果显示,尽管某些框架在感知解析与基础任务调度上表现良好,但在关乎底线伦理的安全与风险防御、社会规则协同以及部分垂直领域的专业落地能力上,多数框架表现不佳。这种“能力失衡”暴露出行业在追求智能体高度自主与自由时,对安全的考量存在明显缺位。

随着大模型及智能体在金融、医疗、教育等关键行业的深入应用,企业对系统稳定性、输出可靠性和风险可控性的要求水涨船高。核心诉求已从最初的“能用”,转变为对“可信、可靠、可控”的全面追求。在此背景下,企业迫切需要一套具备可对比性和实践价值的评测体系,用以指导大模型选型、智能体框架选型、场景适配以及潜在风险识别。

郑子彬建议,应着力构建全维度、可落地的大模型及智能体安全评测体系,推动评测工作真正落地。这不仅能帮助企业查漏补缺、优化升级,更意味着人工智能安全治理思路的一次重要转变——从被动的“监管约束”转向主动的“服务赋能”。通过专业技术助力企业排查风险、优化模型,为智能体的合规落地提供清晰的技术标尺与改进方向,从而推动整个产业安全、健康地发展。

为此,其团队已围绕大模型和智能体分别构建了体系化的评测框架。其中,大模型可信能力评测框架涵盖了37个细分维度;智能体可信能力评测框架则更为细致,覆盖68个细分维度。依托百万级数据,通过自动化检测与智能分析,能够生成针对企业具体大模型及智能体的专属安全评估报告,精准定位风险所在。

本次“AI新治向”系列沙龙由粤港澳大湾区生成式人工智能安全发展联合实验室与南方都市报社联合主办,并得到广东省网络数据安全与个人信息保护协会的支持。活动汇聚了相关政府部门、司法机构、学界、企业及媒体等多方代表,共同聚焦国家网信办等三部门联合印发的《智能体规范应用与创新发展实施意见》核心要求,深入剖析智能体应用安全风险的底层逻辑,探讨多元共治与创新实践方案。

出品:南都大数据研究院

采写:南都研究员 罗韵

摄影:南都N视频记者 袁炯贤

本文转载于:https://www.163.com/dy/article/KTG0D1IJ05129QAF.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注