商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 35B Agent超越万亿参数模型?上海AI Lab开源Agents-A1:scaling the Horizon!

35B Agent超越万亿参数模型?上海AI Lab开源Agents-A1:scaling the Horizon!

  发布于2026-08-19 阅读(0)

扫一扫,手机访问

在AI Agent的诸多挑战里,长程(Long-Horizon)任务算得上是块硬骨头。软件工程、科学研究和复杂决策这类场景,要求Agent在长时间跨度里连续决策,一步走错,后面的路就可能全偏了。过去大家默认的办法是上更大的模型,靠参数规模硬扛;扩展Agent Horizon倒也是个方向,但基础设施跟不上,各种异构能力也很难拧成一股绳。

不过,上海AI Lab团队最近放出的新模型Agents-A1,倒是给出了另一种思路——不堆参数,靠扩展Agent Horizon,用更小的模型来逼近万亿参数级模型的长程表现。这是一个35B参数的MoE Agent模型。

论文链接:https://arxiv.org/abs/2606.30616

研究结果显示,在多步搜索、科学研究和长指令遵循这些任务上,Agents-A1的部分表现已经超过了某些万亿参数级的模型。在同规模的35B模型里,它更是稳稳的第一梯队。

图|Agents-A1 的基准测试表现。

不过话说回来,研究团队自己也承认,Agents-A1在工程类任务上和前沿大模型之间仍有差距。这项研究的核心贡献在于,它找到了一条更经济的路径来开发强大的AI Agent:教会模型养成更持久、更经得起验证的工作习惯,而不是一味地扩大参数规模。

Agent-A1 是如何设计的?

Agents-A1是一个面向长程任务的35B参数MoE Agent模型,它的设计思路非常清晰——依托一套长程知识-动作基础设施,通过三阶段训练,把多种Agent能力整合到同一个模型里。简单来说,就是先做全领域SFT,再专门训练各领域的“教师”模型,最后通过多教师on-policy distillation(OPD)完成统一。

1. 全领域监督微调(SFT)
这个阶段的目标是打好基础,让模型具备通用的Agent能力。团队使用了多领域、多任务的高质量长程轨迹数据进行训练,重点增强模型在长上下文条件下的理解、推理和指令遵循能力。训练中用了sample packing技术,把多个较短的样本拼到一个序列里,配合注意力掩码防止串扰,既减少了padding开销,又提升了GPU利用率。

2. 领域级教师模型训练
团队将模型能力拆解为搜索、科学推理、指令遵循和工具调用四大专长,分别设计了训练方案。

  • 搜索教师:采用“先SFT、后RL”的两阶段训练,结合GRPO来提升复杂问题拆解、多跳搜索和工具协同能力。目标是保证正确率的同时,减少不必要的冗余搜索。
  • 科学教师:通过两阶段SFT,先强化科学推导能力,再通过工具增强轨迹训练外部交互和证据整合能力。关键是让模型学会什么时候该借助外部工具,并整合检索或计算得到的证据。
  • 指令遵循教师:采用两阶段RL和GRPO训练。第一阶段提升对格式、长度、关键词和语言等细粒度约束的满足能力;第二阶段则强化长上下文ICL中的证据定位、信息整合和上下文规则遵循能力。
  • 工具调用教师:同样使用工具SFT与工具RL的两阶段优化,重点学习何时调用工具、如何纠错以及何时结束任务。结合结果奖励、过程奖励和高质量困难任务复用,让模型把工具用得更好。

3. 统一模型阶段
团队先收集学生模型自己生成的轨迹,再由对应领域的教师模型来打分指导。这和离线模仿不同,教师直接评估学生自身产生的轨迹。最终,模型通过按领域路由的蒸馏和显著词汇对齐,既保留了全领域SFT的广泛能力,又把各领域教师的专长收归己用。

图|Agents-A1 三阶段训练流程概览。

为支撑这一整套训练流程,团队还构建了一套以知识-动作图KAG为核心的基础设施,并通过自博弈不断扩展高质量的长轨迹数据。这样一来,训练样本不仅包含问题和答案,也完整保留了工具使用的整个过程和验证步骤。

图| Agents-A1 的知识-动作基础设施概览。

实验结果

总体来看,Agents-A1在长程搜索、指令遵循和科学推理这些任务上的表现相当亮眼。不仅在同规模35B模型里一骑绝尘,部分基准上甚至超过了万亿参数级的模型。具体来看:

图|Qwen3.5-35B-A3B、Agents-A1-SFT 和 Agents-A1 的性能对比。

1. 全领域SFT
Agents-A1-SFT在长程搜索、工程任务和科学研究这些方向上提升明显,但在通用Agent任务、指令遵循和HLE上却出现了回落。这也说明,单靠全领域SFT,还不足以解决不同推理模式之间的冲突问题。

2. 领域教师模型训练
搜索增强教师:在四个基准上都稳定优于Qwen3.5-35B-A3B。尤其在通用AI助手基准GAIA上,提升最为显著,从59.8直接跃升到95.1。

图|Qwen3.5-35B-A3B 与搜索增强教师模型的性能对比。

科学增强教师:两阶段SFT显著增强了模型的科学推理和工具交互能力。相比基线模型,科学增强教师在各项科学任务上整体更优,尤其是在FS-R上,从2.5大幅提升到了54.3。

图|Qwen3.5-35B-A3B 与科学增强教师模型的性能对比。

指令遵循与长上下文学习:强化学习显著提升了模型的长上下文理解、指令遵循以及对可验证指令约束的泛化能力。总体上,RL增强教师在相关评测中优于Qwen3.5-35B-A3B,其中LongBench V2和IFBench的提升尤为突出。

图|Qwen3.5-35B-A3B 与 RL 增强教师模型在 LongBench V2、IFBench 和 IFEval 上的评测结果。

工具调用:显式的工具使用监督与强化学习显著提升了模型的工具调用能力,特别是在需要多轮、结构化交互的任务中,效果尤为明显。工具增强模型在τ²-Bench和VitaBench上都取得了显著进步。

图|Qwen3.5-35B-A3B 与工具增强 RL 教师模型在 τ²-Bench 和 VitaBench 上的性能评测结果。

统一模型实验:结果显示,多教师OPD比单纯的全领域SFT更能缓解不同任务推理模式之间的冲突。它在保留广泛能力覆盖的同时,把各领域的专长整合得更好,进一步提升了长程任务的表现。

图|Agents-A1 与 35B / 1T 级模型的对比。

除了标准基准测试,团队还用两个案例展示了Agents-A1的长程Agent能力。在鲸鱼叫声检测任务中,Agents-A1能在较长时间跨度内持续优化完整的机器学习流程。在一次12小时的运行里,模型从简单的CNN基线出发,把验证集AUC从0.58一路提升到了0.9935。这意味着Agents-A1已经超越了局部调参,具备了在多轮迭代中持续改进方案、提升泛化能力的能力。

图|Agents-A1 在 ICML 2013 Whale Challenge 上一次 12 小时运行中的优化轨迹。

Agents-A1在地球科学任务中也展现出了端到端的分析能力。以2008年热带气旋Nargis为例,模型能够自动识别数据源,完成数据提取、清洗、派生指标计算、可视化和结果综合,形成一个从规划到报告生成的多阶段闭环,并且较高保真度地重建了风暴的演化过程。

图|由 Agents-A1 生成的 2008 年热带气旋(Nargis)的路径。

不足和未来方向

尽管Agents-A1在多项长程任务上表现不俗,但短板也同样存在。首先,模型在“先规划再推理”、“先反思再行动”、长上下文关键信息总结以及重要历史信息识别这些基础原子能力上,还有提升空间。这些能力直接决定了长程任务中的稳定性、目标一致性和执行效率。未来需要重点强化这些基础能力,并以此进一步提升Agents-A1的长过程求解能力。

其次,在机器学习工程任务上,Agents-A1与更大模型之间的差距依然明显。如何增强模型在完整工程流程中的目标一致性、决策记忆和试验效率,是一个重要的研究方向。

最后,经过OPD训练的统一学生模型,并不能在所有领域都稳定超过对应的教师模型。如何在模型统一性与领域专长之间找到更好的平衡点,是后续需要继续解决的问题。

更多技术细节,详见原论文。

本文转载于:https://www.163.com/dy/article/L0R421E70531E3NX.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注