当前位置:

首页 > 业界资讯 > AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

在当前的AI时代,自主智能体被认为是通向通用人工智能(AGI)的一条有前途的途径。自主智能体指的是能够通过自主规划和指令来完成任务的实体。在早期的开发模式中,智能体的行动策略主要基于启发式,并在与环境的交互中逐步改进然而,在无限制的开放环境中,自主智能体的行动往往难以达到人类的熟练水平近年来,大语言模型(LLM)取得了巨大的成功,并展现出实现类人智能的潜力。由于其强大的能力,LLM被越来越多地用作创建自主智能体的核心协调者,并出现了各种各样的AI智能体。这些智能体通过模仿类人的决策过程,为更复杂和适应性更

在当前的AI时代,自主智能体被认为是通向通用人工智能(AGI)的一条有前途的途径。自主智能体指的是能够通过自主规划和指令来完成任务的实体。在早期的开发模式中,智能体的行动策略主要基于启发式,并在与环境的交互中逐步改进

然而,在无限制的开放环境中,自主智能体的行动往往难以达到人类的熟练水平

近年来,大语言模型(LLM)取得了巨大的成功,并展现出实现类人智能的潜力。由于其强大的能力,LLM 被越来越多地用作创建自主智能体的核心协调者,并出现了各种各样的AI智能体。这些智能体通过模仿类人的决策过程,为更复杂和适应性更强的AI系统提供了一条可行的路径

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

基于LLM的自主智能体一览,包括工具智能体、模拟智能体、通用智能体和领域智能体

对于已经出现的基于LLM的自主智能体进行整体分析,在当前阶段非常重要。这样做可以全面了解该领域的发展现状,并且对未来的研究提供启发,具有重要意义

在这篇文章中,中国人民大学高瓴人工智能学院的研究人员对基于LLM的自主智能体进行了全面调查,并关注了它们的构建、应用和评估三个方面

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

请点击以下链接查看论文:https://arxiv.org/pdf/2308.11432.pdf

为了构建智能体,研究者提出了一个由四部分组成的统一框架。这四部分分别是配置模块,用于表示智能体的属性;需要进行改写的内容是:记忆模块,用于存储历史信息;重新编写的内容是:设计模块,用于制定未来行动策略;以及行动模块,用于执行规划决定。在介绍了典型的智能体模块之后,研究者还总结了常用的微调策略,通过这些策略来增强智能体在不同应用场景中的适应性

研究者在接下来的内容中概述了自主智能体的潜在应用,并探讨了它们对社会科学、自然科学和工程学领域的增益。最后,讨论了自主智能体的评估方法,包括主观和客观评估策略。下图展示了文章的整体架构

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述图源:https://github.com/Paitesanshi/LLM-Agent-Survey

基于 LLM 的自主智能体构建

为了提高基于LLM的自主智能体的效率,需要考虑两个方面:首先,设计一个能够更好利用LLM的架构;其次,有效地学习参数的方法

智能体架构设计:本文提出了一个统一的框架来总结之前研究中提出的架构,整体结构如图2所示,它由分析(profiling)模块、需要进行改写的内容是:记忆模块、重新编写的内容是:设计模块以及需要重新写作的是:动作模块组成

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

总结而言,重写内容为:分析模块的目的是识别智能体的角色;记忆和重新编写的内容是:设计模块可以将智能体置于动态环境中,使其能够回忆过去的行为并计划未来的行动;需要重新写作的是:动作模块负责将智能体的决策转化为具体的输出。这些模块中,重写内容为:分析模块对记忆和重新编写的内容是:设计模块产生影响,而这三个模块共同影响需要重新写作的是:动作模块

重写内容为:分析模块

自主智能体通过特定角色来执行任务,例如程序员、教师和领域专家。重写内容为:分析模块旨在表明智能体的角色是什么,这些信息通常被写入输入提示中以影响 LLM 行为。在现有的工作中,有三种常用的策略来生成智能体配置文件:手工制作方法;LLM-generation 方法;数据集对齐方法。

需要进行改写的内容是:记忆模块

需要进行改写的内容是:记忆模块在 AI 智能体的构建中起着非常重要的作用。它记忆从环境中感知到的信息,并利用记录的记忆来促进智能体未来的动作。需要进行改写的内容是:记忆模块可以帮助智能体积累经验、实现自我进化,并以更加一致、合理、有效的方式完成任务。

重新编写的内容是:设计模块

当人类面临复杂任务时,他们首先将其分解为简单的子任务,然后逐一解决每个子任务。重新编写的内容是:设计模块赋予基于 LLM 的智能体解决复杂任务时需要的思考和规划能力,使智能体更加全面、强大、可靠。本文介绍了两种重新编写的内容是:设计模块:没有反馈的规划以及有反馈的规划。

需要重新写作的是:动作模块

需要重新写作的是:动作模块的目的是将智能体的决策转化为具体的结果输出。它直接与环境进行交互,决定智能体完成任务的有效性。本节将介绍动作目标、策略、动作空间和动作影响

本章除了上述的四个部分之外,还会介绍智能体的学习策略。这些策略包括从示例中学习、从环境反馈中学习以及从与人类的互动反馈中学习

请参考表1,其中列出了之前的工作和本文的分类法之间的对应关系

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

基于 LLM 的自主智能体应用

本章将讨论基于LLM的自主智能体对社会科学、自然科学和工程领域的革命性影响

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

例如,可以利用基于LLM的智能体来设计和优化复杂的结构,如建筑物、桥梁、水坝和道路等。之前,研究人员提出了一个交互式框架,让人类建筑师和AI智能体在3D模拟中共同构建结构环境。交互式智能体能够理解自然语言指令、放置模块、寻求建议,并结合人类的反馈,展示了在工程设计中人机协作的潜力

在计算机科学和软件工程领域,基于LLM的智能体具有自动化编码、测试、调试和文档生成的潜力。研究者提出了ChatDev,这是一个端到端的框架,多个智能体通过自然语言对话进行沟通和协作,以完成软件开发生命周期。ToolBench可以用于代码自动补全和代码推荐等任务。MetaGPT可以扮演产品经理、架构师、项目经理和工程师等角色,内部监督代码生成并提高最终输出代码的质量等等

以下是基于LLM的自主智能体的代表性应用的列表:

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

基于 LLM 的自主智能体评估

本文将讨论两种常用的评估策略:主观评估和客观评估

需要重写的内容是:主观评估是通过人类使用互动、评分等多种方法对基于LLM的智能体的能力进行测试。通常情况下,参与评估的人员是通过众包平台招募的。然而,一些研究者认为众包人员的能力存在差异和不稳定性,因此也会使用专家注释来进行评估

在当前的一些研究中,我们可以使用LLM智能体作为主观评估者。例如,在ChemCrow研究中,EvaluatorGPT通过指定等级来评估实验结果,该等级既考虑任务的成功完成,又考虑基本思维过程的准确性。又比如,ChatEval组建了一个基于LLM的多智能体裁判小组,通过辩论来评估模型的生成结果

与主观评估相比,客观评估具有多种优势。客观评估是指使用定量指标来评估基于LLM自主智能体的能力。本节将从指标、策略和基准的角度回顾和综合客观评估方法

在评估过程中,我们可以将这两种方法结合起来使用

以下是以前的工作与这些评估策略之间的对应关系的总结:

AI自主智能体的全面概览:构建、应用、评估全方位覆盖,人大高瓴文继荣等32页综述

请参考原论文以了解更多内容

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型
相关文章 更多
特斯拉FSD新增滑板识别模型
特斯拉FSD新增滑板识别模型

近日,有汽车领域博主爆料,特斯拉的FSD(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、玩滑板的行人、推婴儿车的行人,以及道路清扫车、三轮车、拖车、火车和有轨电车等。这一系列高精度建模意味着FSD系统将能更准确识别并响应复杂交通参与者的行为。据CNMO掌握的消息,日本方面已为特斯拉FSD系统的落地扫

4TB数据搬运:物理传输更高效
4TB数据搬运:物理传输更高效

在千兆宽带、5G通信与云服务深度普及的2026年,大众普遍以为超大文件传输已步入“秒级时代”,但现实远未达到这般畅快。当面对数TB乃至数十TB级别的庞大数据集时,当下最可靠、最迅捷且兼顾安全性的传输方案,依然是“物理位移”——依靠人工携带存储介质完成跨地域交付。一位来自河南信阳的用户讲述了真实经历:他曾需将4TB资料从信阳送往郑州,首次尝试纯网络传输,系统预估总耗时近72小时;最终改用专人驱车运送,单程仅需约2.5小时,当天即完成取件与送达,整体效率显著超越线上方式。该实例迅速引发热议,多位资深IT博主随

阿里开源14B电影级视频模型,实测可玩
阿里开源14B电影级视频模型,实测可玩

AI视频生成正迎来属于“通义”的高光时刻!就在昨晚,阿里巴巴悄然推出了一款由音频驱动的14B视频大模型——Wan2.2-S2V。只需上传一张静态图片和一段音频,就能生成出面部表情生动、口型精准匹配、肢体动作流畅自然的电影级数字人视频,效果惊艳。实际效果展示如下:△来自@AIMIRAI46487更令人振奋的是,这款新模型一经发布便全面开源,现在所有人都可以免费在通义万相官网体验使用。据官方介绍,Wan2.2-S2V的核心优势包括:支持最长分钟级的单次视频生成,画面稳定且具有一致性;具备影院级别的音

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

SOTA大模型加密数据评测:Qwen3仅破10%
SOTA大模型加密数据评测:Qwen3仅破10%

大语言模型面对加密数据,即便最新的Qwen3也会感到压力!尽管当下各类推理模型在多种基准测试中表现优异,但在密码学这样对逻辑严谨性和细节准确性要求极高的专业领域,模型的推理能力还有待深入挖掘。密码学不仅要求模型具备高级数学运算能力和严密的逻辑推理链,还需要其能够精准辨识复杂加密模式中的潜在规律;成功解密要求模型拥有极强的综合推理能力。上海AILab等联合推出的CipherBank测评,使用大量真实隐私场景数据和多种密码算法,严苛挑战当前最先进的大模型。CipherBank的测评结果显示,目前的大语言模型

通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API
通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API

强化学习(RL)结合真实搜索引擎可以显著提升大模型的检索和推理能力。然而,这一方法面临两大挑战:搜索引擎返回的文档质量不稳定,导致训练过程中的噪音和不稳定性;RL训练需要频繁部署,产生大量API开销,限制了可扩展性。针对这些问题,阿里通义实验室推出了开源解决方案ZeroSearch,这是一个无需与真实搜索引擎交互的强化学习框架。实验表明,ZeroSearch只需使用3B参数的LLM作为检索模块,就能有效提升搜索能力,并大幅节省API成本。ZeroSearch让LLM实现自给自足

雷克沙ArmorSD卡测评:全金屬防護三防加持存储更安心
雷克沙ArmorSD卡测评:全金屬防護三防加持存储更安心

无论是专业摄影师还是摄影爱好者,相机内存储卡的可靠性都至关重要,尤其是在恶劣的拍摄环境中,数据存储的安全性更是不可忽视。尽管市场上有多种支持三防功能的移动存储设备用于数据备份,但最常用的SD存储卡由于采用塑料外壳,长期使用后容易出现破损,导致数据损坏,甚至可能损坏相机的存储卡槽,带来的损失不可估量。国际存储品牌雷克沙推出了全新的Armor系列SD存储卡,不仅读写速度快,还采用了不锈钢材质的外壳,具有优异的防水、防尘和防跌落性能,为相机的原始拍摄数据提供了可靠的保护。雷克沙ArmorSD存储卡分为GOLD

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

第一章:计算机系统全方位概述
第一章:计算机系统全方位概述

1.1计算机发展历程[计组]1.0_你好,我是计算机组成原理我们生活在一个信息化程度极高的世界中,我们每天的生活都离不开电脑和手机,这些设备实际上都属于计算机的范畴。计算机的底层结构由硬件构成,在硬件之上,我们会安装操作系统,再在操作系统上运行各种应用软件,这样就能得到一个易于使用的计算机系统。通过计算机网络,这些设备实现了信息的互联互通,这正是我们现在生活的信息化世界的缩影。计算机组成原理这门课研究的就是这些计算机硬件在底层如何协同工作。既然我们要研究硬件,不妨先来看一下大家日常生活中常见的一些硬件

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。