DeepSeek R1推理测试:Arc Pro B70吞吐最高2320.76 token/s
蓝戟测试ArcProB70四卡运行DeepSeekR1,并发128时吞吐量比5090D高8.6%,比4090D高34.2%;单卡峰值2320.76token/s,高并发表现突出,传统性能判断需重新审视。
蓝戟最近干了一件事,让整个AI硬件圈都有些意外——他们拿英特尔Arc Pro B70 GPU去跑DeepSeek R1模型,结果在吞吐量上,竟然把RTX 5090D和RTX 4090D都给比下去了。
这不是虚构场景,而是实打实的测试。测试环境用的是四张显卡并行,参与对比的核心选手有三款:英特尔Arc Pro B70 32GB、英伟达RTX 5090D 32GB和RTX 4090D 24GB。评估标准也很明确——DeepSeek R1-Distill Qwen 32B FP16模型,固定输入输出长度128个tokens,并发范围从1一直拉到512,核心看token/s吞吐量。
数据摆出来,结果相当有意思。当并发低于32时,RTX 5090D稳稳地站在顶端,RTX 4090D紧随其后,Arc Pro B70的表现则基本能与4090D打个平手。
但转折点出现在并发提升之后——当并发数达到32和64的时候,Arc Pro B70已经开始追平乃至反超RTX 4090D。到并发128这个关键节点,Arc Pro B70的token吞吐量比RTX 5090D高出8.6%,比RTX 4090D高出34.2%。
随着并发继续走高,这个优势还在扩大:并发256时,Arc Pro B70比RTX 5090D高7.5%,比RTX 4090D高48.7%;并发512时,差距依然维持在这个量级。


更直观的数据是单卡峰值表现:英特尔Arc Pro B70 GPU最终的Tokens吞吐量达到了每秒2320.76个Token,在所有参测显卡中排在首位。

这组数据释放出的信号其实很明确:在高并发的AI推理场景中,传统的“性能等级”判断方式可能需要重新审视。英伟达在单卡绝对算力上仍然占据优势,但英特尔Arc Pro B70在大规模并发任务下的吞吐表现,显然找到了自己的节奏。对于关注大模型推理部署效率的团队来说,这无疑是一个值得认真考虑的选项。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















