发布于2026-06-16 阅读(0)
扫一扫,手机访问
重磅消息:国际机器学习大会(International Conference on Machine Learning,简称 ICML)2026 的录用结果刚刚出炉,滴滴这边有 5 篇高质量学术成果被收入囊中。这次中稿的论文分别来自滴滴L Lab团队和滴滴网约车交易市场技术团队,合作方包括中山大学、香港科技大学(广州)、北京大学、上海财经大学等高校。可以发现,在将前沿研究与产业需求对接这件事上,滴滴一直在往前推进,而且越来越重视与学术界的合作。
先说说 ICML 本身。作为机器学习领域公认的顶会,它也是中国计算机学会(CCF)推荐的 A 类国际学术会议。第 43 届会议将于 2026 年 7 月 6 日到 11 日在韩国首尔举行。本届竞争激烈程度可见一斑:总共收到 23918 份提交论文,最后仅录用 6352 篇,其中 526 篇被选为 Spotlight Paper。能在这样的筛选率下脱颖而出,说明这五篇论文确实是“硬通货”。
下面就把这五篇论文挨个介绍一下(排名不分先后)。
合作方: 滴滴 L-Lab × 中山大学
研究方向: 大模型智能体评估基准 / 长周期(Long-Horizon)任务推理、规划与工具使用

这篇论文直击当前自主智能体评估中的一个明显盲区:现实世界中那些需要持续推理、持续记忆管理以及频繁调用工具的复杂长周期任务,现有的基准测试往往覆盖不到。为了让评估更贴近真实场景,团队提出了一个全新的跨环境探索基准——UltraHorizon,特点是智能体交互轨迹极长、Token消耗极高、工具调用极其频繁。
大规模实验的结果有点“扎心”:目前最先进的大模型智能体在这些任务上的表现远不如人类,而且不是简单地靠扩大模型规模就能搞定。失败的原因主要归结为两点:上下文锁定(in-context locking)和基础能力的缺失。这为后续的研究指明了方向,也说明长周期任务这块还有很多硬骨头要啃。
合作方: 滴滴 L-Lab(独立完成)
研究方向: 多模态大模型(MLLM)智能体 / GUI 自动化 / 自进化记忆系统

多模态大语言模型(MLLM)在完成复杂的GUI自动化任务时,经常会陷入记忆混乱或上下文过长的困境。针对这个问题,团队提出了达尔文记忆系统(Darwinian Memory System,简称DMS)。这个系统的设计思路相当巧妙:它借鉴了自然选择机制,利用效用驱动的“优胜劣汰”来动态分解任务,同时逐步淘汰那些次优策略。
简单说,就是把记忆系统做成了一个能不断进化的“生态圈”。最让人眼前一亮的是,DMS不需要额外进行模型训练——它能在零训练的情况下显著提升MLLM智能体的任务成功率、执行稳定性和整体效率。这对实际部署来说意义很大,因为节省了大量的计算资源。
合作方: 滴滴 L-Lab × 中山大学
研究方向: 持续离线强化学习(Continual Offline RL) / 跨任务知识迁移与隔离 / 层次化任务表示

在持续离线强化学习(CORL)中,如何实现跨任务的知识复用同时避免任务之间的互相干扰,一直是个难解的课题。HTAC(Hierarchical Task-Aware Composition)这个框架给出了一个漂亮方案:通过双层任务编码与软组合机制,将任务解耦为域级与任务级嵌入,再配合按需创建的专家网络和注意力式的知识整合,实现了参数高效的知识隔离与复用。
说人话就是:系统既能记住不同任务的有用经验,又不会在切换任务时“学一个忘一个”。在离线持续世界基准上的测试表明,HTAC在可塑性与稳定性之间取得了不错的平衡,显著提升了智能体跨任务泛化和知识迁移的能力。这对于自动驾驶、机器人等需要持续学习的场景非常重要。
合作方: 滴滴 L-Lab × 香港科技大学(广州)
研究方向: 大语言模型智能体
大模型智能体在多轮交互中,有一个非常朴素但也非常头疼的效率问题:上下文越来越长,处理成本越来越高。现有的压缩方法往往是“一刀切”,对思考过程和环境观察进行统一压缩,完全忽略了不同轮次交互之间其实存在巨大的效用差异。
Agent-Omit框架的出发点就是“有的放矢”——根据每个交互轮次的实际价值,有选择性地省略不重要的上下文信息。这样做的好处很明显:既能保留关键推理线索,又能大幅降低token消耗,从而提升整体执行效率。对于需要长期运行的智能体系统来说,这种“聪明”的省略机制会是提升商业落地可行性的关键。
合作方: 滴滴网约车交易市场技术团队 × 北京大学 × 上海财经大学
研究方向: 离线强化学习 / 自动驾驶场景 / 部分可观测世界模型
自动驾驶决策中,一个核心挑战是:系统必须面对部分可观测的环境(比如某些车辆或行人被遮挡),但同时又需要在有限的离线数据中学习。这篇论文提出用部分可观测世界模型来强化离线强化学习的效果,让模型在训练阶段就能更好地模拟和理解不确定环境,从而在真实路上场景中做出更稳健的决策。
整体来看,这五篇论文覆盖的领域相当广,从智能体评估基准、GUI自动化到持续强化学习、自动驾驶决策,既有理论深挖,也有明确的产业应用场景。可以预见,这些研究成果将在滴滴的业务场景(比如智能调度、自动驾驶、客服助手等)中逐渐发挥实际价值。
话说回来,顶级会议中稿只是起点,真正考验技术团队的是如何让这些前沿探索与产业需求相互激发,最终变成用户能感知到的更好体验。滴滴这几个团队走得是稳的,接下来就看落地了。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9