商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > AMD 推出 vLLM-ATOM 插件,加速 DeepSeek、Kimi 等 AI 推理性能

AMD 推出 vLLM-ATOM 插件,加速 DeepSeek、Kimi 等 AI 推理性能

  发布于2026-05-30 阅读(0)

扫一扫,手机访问

5月12日,一则来自科技媒体Wccftech的消息引起了业内的注意。报道称,AMD悄然推出了一款名为vLLM-ATOM的插件,其目标直指一个核心痛点:如何在不改变开发者现有习惯的前提下,显著提升大语言模型的推理效率。

这里需要先明确一下vLLM的背景。它并非普通的单次推理工具,而是一个专为高并发服务场景设计的开源推理框架。它的强项在于请求调度、KV缓存管理和连续批处理,旨在优化吞吐量和显存利用率,是企业将大模型部署为长期在线服务的常用选择。

AMD此次的策略相当巧妙。vLLM-ATOM插件本质上是一套为AMD Instinct GPU量身定制的优化方案,但其最大卖点是“无缝衔接”。开发者无需改动现有的vLLM命令、API和端到端工作流,插件会在后台自动接管优化任务,将计算引导至更高效的路径。

AMD 推出 vLLM-ATOM 插件,加速 DeepSeek、Kimi 等 AI 推理性能

vLLM-ATOM 架构与 MI300X、MI355X 示意

三层架构解析

从公布的架构图来看,vLLM-ATOM主要面向Instinct MI350、MI400以及MI355X等系列GPU,其设计清晰地分为三个层次:

最上层是原有的vLLM框架,它继续负责请求调度、KV缓存管理、连续批处理以及维护对OpenAI API的兼容性。中间层则是全新的ATOM插件,扮演着“翻译官”和“调度员”的角色,负责平台注册、模型实现、注意力机制的后端路由以及内核调优。最底层是AITER,它提供了直接运行在GPU上的核心计算内核,包括融合的MoE专家系统、Flash Attention、量化GEMM以及RoPE融合等优化技术。

降低部署门槛是关键

对于企业和开发者而言,这套方案的价值远不止于“速度更快”。其核心吸引力在于大幅降低了部署门槛。AMD将其宣传为“零学习成本”,这意味着那些已经基于vLLM构建了服务流程的团队,理论上可以平滑地将后端迁移到AMD硬件上,无需进行伤筋动骨的重构。

在模型支持方面,该插件展现了良好的兼容性。它覆盖了包括Qwen3、DeepSeek、GLM、gpt-oss、Kimi在内的多个主流模型系列。更重要的是,它支持从稠密模型到混合专家模型,乃至文本加视觉的多模态大模型场景,显示了其架构的灵活性。

具体到一些代表模型,例如Qwen3-235B-A22B-Instruct-2507-FP8、DeepSeek-R1-0528、openai / gpt-oss-120b以及amd / Kimi-K2.5-MXFP4等,都已在其支持列表之中。

AMD 推出 vLLM-ATOM 插件,加速 DeepSeek、Kimi 等 AI 推理性能

AMD vLLM-ATOM 与 Instinct GPU 配图
本文转载于:https://www.ithome.com/0/949/168.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注