当前位置:

首页 > 硬件相关 > 北大与 DeepSeek 联合开源 DSpark:破解 AI 大模型高并发推理瓶颈 速度提升 60% 至 85%

北大与 DeepSeek 联合开源 DSpark:破解 AI 大模型高并发推理瓶颈 速度提升 60% 至 85%

北大与DeepSeek联合开源DSpark推理加速框架,通过半自回归架构与置信度调度验证机制,破解大模型高并发推理瓶颈。在保持吞吐量前提下,单用户生成速度较基线提升60%至85%,已部署于DeepSeek-V4系列预览版。

今天,DeepSeek 联合北大放出了一个值得关注的新东西——DSpark 推理加速框架。这玩意儿的目标很明确:解决大模型在真实高并发场景下的推理效率问题,也就是怎么让用户感觉响应更快、系统吃得消更多人同时用。

目前,这个框架已经用在了 DeepSeek-V4-Flash 和 V4-Pro 的预览版服务里。效果如何?简单说,在保持同样吞吐量的前提下,单个用户能感受到的生成速度,比他们之前用的 MTP-1 基线方案快了 60% 到 85%。论文和代码也已经开源在 GitHub 上。

先聊点背景。大语言模型生成文本时,是典型的“自回归”模式:每吐出一个新 token,就得完整跑一次前向传播。模型输出长度越长,推理延迟就线性增长。这其实是很多 AI 对话系统响应偏慢的核心所在。

推测解码:一个可行的解决方向

推测解码技术提供了一条路径。思路很聪明:先拿一个轻量级的小模型快速猜出一段候选 token,然后再由大模型一次性并行验证这批候选,只保留符合要求的连续前缀。因为验证阶段是并行计算的,再加上拒绝采样机制能严格保证输出分布和原始模型一致,所以理论上可以在不损失生成质量的前提下,大幅提升速度。

但理想很丰满,现实有两个坎:一是候选生成的质量,二是验证阶段对目标模型计算资源的占用。

目前主流方案分成两派。

一派是自回归式草稿模型,比如 Eagle3。它逐个 token 串行生成候选,依赖关系建模能力强,接受率高,但候选越长,生成延迟就越长,逼得实际部署中只能用短候选块和浅层网络。

另一派是并行式草稿模型,比如 DFlash。它一次前向传播就能产出全部候选,生成延迟几乎和候选长度无关,理论上支持更长的候选块。但问题在于,并行生成每个位置时,它无法依赖块内前面已经采样的 token,这就导致随着候选位置往后移,不同语义路径会相互冲突,接受率迅速衰减。长候选块后面的 token,经常在验证阶段被大量拒绝,造成目标模型计算资源的浪费。尤其在高并发环境下,固定长度的验证策略,会让大模型宝贵的批量处理能力,耗费在高拒绝风险的尾部 token 上,最终拖累整体吞吐量。

而 DSpark 的设计,正是围绕这两个瓶颈展开的,提出了两项互补机制。

半自回归架构:并行能力与顺序依赖的结合

在候选生成阶段,DSpark 采用了一种“半自回归”架构。简单说,计算量较大的并行主干网络(基于 DFlash 改进)先一次性产出所有候选位置的隐藏状态和基础 logits;随后,一个轻量级的顺序模块再逐 token 注入前缀依赖信息。这个顺序模块有两种实现方式:一种是只依赖前一个 token 的马尔可夫头,另一种是通过循环状态累积完整前缀信息的 RNN 头。

实验数据证明,两层 Transformer 深度的 DSpark,在所有测试领域上,接受长度已经超越了五层深度的 DFlash。这说明:只要引入少量自回归依赖,参数效率就能完胜单纯堆叠并行层。

置信度调度验证:让验证计算花在刀刃上

在验证调度阶段,DSpark 引入了一套“置信度调度验证”机制。模型在每个候选位置会输出一个置信度分数,预测这个 token 在给定此前所有 token 都被接受的情况下,存活下来的概率。训练完成后,团队在验证集上通过逐位置温度缩放,对置信度进行校准,使其与经验接受率对齐。

在此基础上,一个“硬件感知前缀调度器”将验证长度选择,建模成全局吞吐量最大化问题。给定一批并发请求及其各位置置信度,结合预先实测的引擎吞吐量曲线,调度器会为每个请求动态决定验证多长的候选前缀。它的核心逻辑很简单:优先将目标模型的计算资源,分配给那些全局存活概率最高的 token。

离线测试与在线实战

在离线基准测试中,研究团队选了 Qwen3 系列和 Gemma4-12B 作为目标模型,对比了自回归方案 Eagle3 和并行方案 DFlash。在数学推理、代码生成和日常对话三类任务上,DSpark 的平均每轮接受长度,均优于两类基线。

举个例子,在 Qwen3-4B 上,DSpark 的接受长度比 Eagle3 提升约 30.9%,比 DFlash 提升约 16.3%。进一步分析位置级条件接受率就会发现:DFlash 首位接受率高,靠的是并行架构能支撑更深网络带来的容量优势,但从第 2 位起接受率迅速下滑;Eagle3 正好相反,后续位置保持稳定甚至上升,但首位受限于浅层网络。DSpark 则两条路都占了:继承了并行架构的首位容量优势,同时通过顺序依赖缓解了后续位置的衰减。

到了真实的生产环境部署,DSpark 草稿模型与 DeepSeek-V4-Flash 及 V4-Pro 预览版共同运行。并行主干包含了 3 个 MoE 层与滑动窗口注意力,最大候选块长度设为 5,并采用马尔可夫头作为顺序模块。

训练阶段还有两项系统优化。其一,并行训练时只传递目标模型的隐藏状态而非完整词表 logits,将通信复杂度从 O(V) 降至 O(d);其二,采用锚点定长序列打包策略,把训练序列中随机采样的多个预测块压缩为密集批次,避免了传统填充带来的计算和内存浪费。

实际系统集成时,调度器还遇到了两个工程约束。

  • 第一个是 CUDA 图重放和零开销调度要求下一轮批处理大小必须在当前轮完成前确定,同步调度会导致 GPU 流水线停滞。解决办法是改造为异步模式:用当前轮置信度排序候选 token,但截断长度依据两轮前的历史置信度来预测,从而隐藏了调度延迟。

  • 第二个是动态变长验证前缀,会导致标准解码内核因填充和负载不均而利用率下降。团队将物理执行与逻辑序列跟踪解耦,把所有 token 展平为独立元素处理,通过稀疏注意力中的标记张量传递序列内依赖关系,只需修改索引注意力与压缩内核就能支持动态调度。

在线生产环境的实测结果更说明问题。在 V4-Flash 引擎上,当系统保证单用户生成速度不低于 80 token/s 时,DSpark 的聚合吞吐量比基线提升了 51%。当 SLA 收紧到 120 token/s 时,单 token 基线已经接近运行边界,而 DSpark 依然能维持可用并发批处理,实现了标称 661% 的吞吐量优势。

在 V4-Pro 引擎上,35 token/s 的 SLA 下,吞吐量提升 52%;50 token/s 的 SLA 下,提升直接来到 406%。而在匹配的实际吞吐量水平下,DSpark 将单用户生成速度提升了 57% 到 85%。

调度器也表现出了负载自适应的能力。系统并发数低时,它会分配 4 到 6 个 token 的验证长度,充分用足空闲计算资源;并发数一高,就平滑缩减验证长度,避免资源争用。

当然也有局限。即便后缀 token 最终被调度器截断,并行主干仍需为所有请求生成完整的初始候选块。对那些本身接受率就低的复杂查询,这部分草稿计算开销是无法回收的。

目前,DeepSeek 已经在 GitHub 的 DeepSpec 项目里开源了 DSpark、DFlash 和 Eagle3 三种草稿模型的训练代码、评估脚本及模型检查点。

参考资料:

  • GitHub:https://github.com/deepseek-ai/DeepSpec

  • Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系bd@zhengruan.com
作者最新文章
硬件相关
相关文章 更多
显示器色温怎么调不刺眼?色温调多少看着最舒服
显示器色温怎么调不刺眼?色温调多少看着最舒服

详解显示器色温的舒适调节区间、刺眼的核心诱因,以及在不同使用场景与环境光下的具体调节步骤与校准方法。

显卡风扇不转怎么回事判断是否正常及解决方法
显卡风扇不转怎么回事判断是否正常及解决方法

发现显卡风扇不转先别慌,这很可能是正常的智能启停功能。本文详解如何区分待机静音与硬件故障,提供从软件检测到物理清理的完整解决思路。

笔记本加内存条后无法开机怎么办及解决方法
笔记本加内存条后无法开机怎么办及解决方法

笔记本加装新内存后遇到黑屏或无法开机?不要慌张,本文通过重新插拔、清洁金手指、单根测试等具体操作步骤,帮你快速判断是安装失误还是硬件不兼容,并给出相应解决办法。

电脑主机前置usb不能用怎么解决排查修复教程
电脑主机前置usb不能用怎么解决排查修复教程

针对电脑主机前置USB接口无法识别设备的问题,本文提供一套基于因果逻辑的排查流程。涵盖检查机箱内部USB针脚连接、验证BIOS中USB控制器状态、更新芯片组驱动以及排除供电不足等常见原因,帮助用户快速恢复接口功能。

无线鼠标充不进电解决办法及故障排查步骤
无线鼠标充不进电解决办法及故障排查步骤

遇到无线鼠标充不进电的问题,不要急于更换设备。本文详解从清理接口氧化层、更换数据线到检测电池电压的完整排查流程,帮助你判断是临时故障还是硬件损坏。

蓝牙游戏手柄连接教程吃鸡
蓝牙游戏手柄连接教程吃鸡

想知道如何用蓝牙手柄玩吃鸡游戏?本文详细讲解手机蓝牙手柄的连接步骤、主流映射软件的使用方法以及实战中的键位布局技巧,助你提升射击手感,同时解析外设玩家的匹配机制与注意事项。

游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法
游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法

本文深入分析游戏手柄蓝牙频繁断开且需重连的根本原因,涵盖电池电压检测、操作系统电源管理策略及驱动冲突。通过具体的系统设置调整和固件更新步骤,解决蓝牙握手失败问题,恢复手柄的稳定连接状态。

显示器画面模糊抖动怎么解决及排查方法教程
显示器画面模糊抖动怎么解决及排查方法教程

遇到显示器画面模糊或抖动时,可通过检查视频连接线、调整系统分辨率与刷新率、更新显卡驱动等步骤进行排查和修复。

小米智能门锁换电池后怎么开机
小米智能门锁换电池后怎么开机

小米智能门锁更换新电池后无法开机或屏幕不亮?本文详解电池极性检查、金属触点清洁及强制重启方法,帮你快速解决供电问题,让门锁恢复正常使用。

电视机声音怎么连接到外置音响
电视机声音怎么连接到外置音响

想让电视声音更震撼?本文详解如何通过HDMI ARC、光纤、蓝牙和3.5mm接口将电视连接至外置音响,包含具体设置步骤与常见问题排查,助你轻松打造家庭影院。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。