小米陈龙谈智驾:先让大模型长到十八岁
小米汽车陈龙阐述XLA认知大模型演进理念,类比人类成长,需先掌握感知理解,再融会贯通实现更优驾驶。XLA区别于常见VLA架构,整合视觉、语言、声音等多模态信息。当前智能驾驶正从“数据驱动”迈向理解复杂场景与行为的“认知驱动”新阶段。
近期,《21汽车·一见Auto》与小米汽车智能驾驶基座大模型负责人陈龙进行了一次深度对话。这位技术负责人用了一个生动的比喻,来解释他们正在构建的智能驾驶系统:“我们小时候学说话、认字,然后通过触摸、抓取来认识世界。等到语言能力和空间理解力成熟后,再去学习驾驶,就能把所有的认知融会贯通,不仅开得快,更能开得好。XLA大模型的成长路径,也是如此。”
今年3月,小米发布新一代SU7,并宣布其辅助驾驶系统升级至XLA认知大模型架构。小米集团董事长雷军在发布会上特别解释了命名缘由:之所以叫“XLA”而非行业通用的“VLA”(视觉-语言-动作模型),是因为这套模型具备了“多模态认知输入”能力——除了视觉和语言,还融入了声音、机器人数据等多种信息维度。

陈龙正是这套XLA认知大模型背后的关键人物。童年时,美剧《霹雳游侠》中那辆拥有自我意识、能自动驾驶并帮助主角化险为夷的智能跑车KITT,在他心里埋下了种子。此后,他的职业路径也始终围绕着让机器“更懂”驾驶这个目标展开。在加入小米前,他曾在英国剑桥大学孵化的自动驾驶公司Wayve任职,是将VLA模型引入辅助驾驶领域的早期实践者之一,其工作核心就是让大模型的决策过程变得更透明、可理解。一年前,他正式加入小米,担任辅助驾驶VLA技术负责人。
当时,小米的辅助驾驶架构还处于“端到端+VLM”阶段。所谓“端到端”,是一种深度学习范式,旨在绕过传统自动驾驶中独立的感知、规划、决策模块,直接向模型输入海量驾驶场景数据,让它学习并输出最终的驾驶行为。陈龙将这一阶段的核心概括为“数据驱动”。客观来看,2024年国内车企及供应商纷纷转向端到端架构,确实让辅助驾驶的整体能力上了一个台阶。
然而,进入2025年,纯数据驱动模式的局限性开始浮现。简单来说,模型通过“死记硬背”海量数据提升了驾驶熟练度,但现实世界总会不断涌现更复杂、更陌生的场景。这时,系统需要的不仅是数据记忆,更是对人类行为和社会规则的深层理解与认知。唯有如此,才能在遇到新情况时像经验丰富的老司机那样“举一反三”,而非瞬间“傻眼”。陈龙将这一新阶段的核心,精准地提炼为“认知驱动”。

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















