当前位置:

首页 > 业界资讯 > 英伟达打脸AMD:H100在软件加持下,AI性能比MI300X快47%!

英伟达打脸AMD:H100在软件加持下,AI性能比MI300X快47%!

12月14日消息,AMD于本月初推出了其最强的AI芯片InstinctMI300X,其8-GPU服务器的AI性能比英伟达H1008-GPU高出了60%。对此,英伟达于近日发布了一组最新的H100与MI300X的性能对比数据,展示了H100如何使用正确的软件提供比MI300X更快的AI性能。根据AMD此前公布的数据显示,MI300X的FP8/FP16性能都达到了英伟达(NVIDIA)H100的1.3倍,运行Llama270B和FlashAttention2模型的速度比H100均快了20%。在8v8服务器中,

英伟达打脸AMD:H100在软件加持下,AI性能比MI300X快47%!

12月14日消息,AMD于本月初推出了其最强的AI芯片Instinct MI300X,其8-GPU服务器的AI性能比英伟达H100 8-GPU高出了60%。对此,英伟达于近日发布了一组最新的H100与MI300X的性能对比数据,展示了H100如何使用正确的软件提供比MI300X更快的AI性能。

根据AMD此前公布的数据显示,MI300X的FP8/FP16性能都达到了英伟达(NVIDIA)H100的1.3倍,运行Llama 2 70B和FlashAttention 2 模型的速度比H100均快了20%。在8v8 服务器中,运行Llama 2 70B模型,MI300X比H100快了40%;运行Bloom 176B模型,MI300X比H100快了60%。

但是,需要指出的是,AMD在将MI300X 与 英伟达H100 进行比较时,AMD使用了最新的 ROCm 6.0 套件中的优化库(可支持最新的计算格式,例如 FP16、Bf16 和 FP8,包括 Sparsity等),才得到了这些数字。相比之下,对于英伟达H100则并未没有使用英伟达的 TensorRT-LLM 等优化软件加持情况下进行测试。

AMD对英伟达H100测试的隐含声明显示,使用vLLM v.02.2.2推理软件和英伟达DGX H100系统,Llama 2 70B查询的输入序列长度为2048,输出序列长度为128

英伟达最新发布的对于DGX H100(带有8个NVIDIA H100 Tensor Core GPU,带有80 GB HBM3)的测试结果显示,使用了公开的NVIDIA TensorRT LLM软件,其中v0.5.0用于Batch-1测试,v0.6.1用于延迟阈值测量。测试的工作量详细信息与之前进行的AMD测试相同

英伟达打脸AMD:H100在软件加持下,AI性能比MI300X快47%!

根据结果显示,英伟达DGX H100服务器在使用优化的软件后,其性能提高了超过2倍,比AMD展示的MI300X 8-GPU服务器快了47%

DGX H100 在1.7秒内可以处理单个推理任务。为了优化响应时间和数据中心的吞吐量,云服务为特定的服务设置了固定的响应时间。这样他们可以将多个推理请求组合成更大的“Batch”,从而增加服务器每秒的总体推理次数。MLPerf 等行业标准基准测试也使用这个固定的响应时间指标来衡量性能

响应时间的微小权衡可能会导致服务器可以实时处理的推理请求数量产生不确定因素。使用固定的 2.5 秒响应时间预算,英伟达DGX H100 服务器每秒可以处理超过 5 个 Llama 2 70B 推理,而Batch-1每秒处理不到一个。

显然,英伟达使用这些新的基准测试是相对公平的,毕竟AMD也使用其优化的软件来评估其GPU的性能,所以为什么不在测试英伟达H100时也这样做呢?

要知道英伟达的软件堆栈围绕CUDA生态系统,经过多年的努力和开发,在人工智能市场拥有非常强大的地位,而AMD的ROCm 6.0是新的,尚未在现实场景中进行测试。

根据AMD之前透露的信息显示,其已经与微软、Meta等大公司达成了很大一部分交易,这些公司将其MI300X GPU视为英伟达H100解决方案的替代品。

AMD最新的Instinct MI300X预计将在2024年上半年大量出货,但是,届时英伟达更强的H200 GPU也将出货,2024下半年英伟达还将推出新一代的Blackwell B100。另外,英特尔也将会推出其新一代的AI芯片Gaudi 3。接下来,人工智能领域的竞争似乎会变得更加激烈。

编辑:芯智讯-浪客剑

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 AMD
相关文章 更多
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

新生力量AMD 发布锐龙 7 4700LE 和锐龙 3 3100U 处理器
新生力量AMD 发布锐龙 7 4700LE 和锐龙 3 3100U 处理器

AMD于2026年推出基于7nmZen2老架构的消费级处理器,包括OEM专供的锐龙74700LE(8核、无核显、65W)和锐龙33100U(2核2线程、Vega8核显),并在COMPUTEX2026上补充锐龙PRO200系列商用新品。

用户反映 AMD Ryzen 处理器默默取消 TSME 内存安全技术支持
用户反映 AMD Ryzen 处理器默默取消 TSME 内存安全技术支持

AMD在AGESA1.2.7.0固件中从消费级Ryzen处理器移除TSME内存加密支持,仅保留给PRO和EPYC系列。该安全技术通过硬件自动加密物理内存数据,防止物理攻击。Linux用户发现后经主板厂商测试确认,功能被硬屏蔽,BIOS开启亦无效。

逼玩家选N卡!A卡涨价自捅一刀:这下更没人买了
逼玩家选N卡!A卡涨价自捅一刀:这下更没人买了

AMD计划7月起将GPU与显存套装供货价上调10%-15%,源于GDDR内存颗粒价格飙升三倍。这是半年内第二次涨价,此前已致销量断崖式下跌。此次涨价将抹平A卡价格优势,迫使玩家转向NVIDIA阵营。

AMD 强调用户数据安全非 PRO 锐龙处理器将于下月恢复 TSME 内存加密
AMD 强调用户数据安全非 PRO 锐龙处理器将于下月恢复 TSME 内存加密

AMD公司计划于2026年7月通过BIOS更新,为桌面锐龙9000非专业版系列重新启用透明安全内存加密(TSME)。此前AGESA1.2.7.0版固件移除了该选项,AMD公司强调重视用户数据安全,而锐龙专业版系列则永久保留TSME加密功能。该技术可有效防止内存数据泄露。

AMD 正式为 RX 7000 显卡提供 FSR 超分 4.1 支持 预告核显用轻量级模型
AMD 正式为 RX 7000 显卡提供 FSR 超分 4.1 支持 预告核显用轻量级模型

AMD正式推送26.6.2驱动,为RadeonRX7000系列显卡提供FSR4.1原生支持,帧率与画质显著提升,并快于第三方MOD版。同时预告为RDNA3架构APU开发轻量级模型,使核显也能支持FSR4.1。已验证RX7600至7900XTX,入门型号待测。驱动还新增游戏支持并修复了闪退与兼容性问题。

颜值与实力并存,AI与生产力全面进化:蓝宝石RX 9070 XT评测
颜值与实力并存,AI与生产力全面进化:蓝宝石RX 9070 XT评测

蓝宝石RX9070XT评测显示,其已普遍支持FSR4(红石技术),画质较FSR3显著提升,AI生态协同能力增强。价格仍维持在五千元档,性价比十分突出。与RTX5070Ti对比及FSR4实际测试将验证其驱动优化效果与新技术表现,整体表现令人期待。

摩根士丹利预估 2027 年 AMD EPYC Venice 出货 675 万颗 超英伟达 Vera 处理器 17%
摩根士丹利预估 2027 年 AMD EPYC Venice 出货 675 万颗 超英伟达 Vera 处理器 17%

据摩根士丹利研报预测,2027年超威半导体基于台积电二纳米工艺与Zen六架构的EPYCVenice中央处理器出货量将达六百七十五万颗,较英伟达采用五纳米工艺、主攻代理型人工智能应用的Vera中央处理器出货量五百七十五万颗领先百分之十七。

外媒在 AMD RDNA 3 显卡上测试:FSR 4.1 超分比 3.1 最多慢 14.5%
外媒在 AMD RDNA 3 显卡上测试:FSR 4.1 超分比 3.1 最多慢 14.5%

在RDNA3显卡上,FSR4.1超分技术帧率低于FSR3.1。基于三款显卡九款游戏测试,质量模式平均降低百分之十一,性能模式平均降低百分之十四点五。RX7800XT和RX7600也类似,分别降低百分之七至百分之九。算法复杂度提高是主要原因,导致计算开销增加,进而影响帧率表现。

V社确认 Steam Machine 主机即将支持 AMD FSR 4,上线时间未定
V社确认 Steam Machine 主机即将支持 AMD FSR 4,上线时间未定

V社官方确认,SteamMachine主机将支持AMDFSR4功能,该功能即将推出但具体时间未定。该主机起步价1049美元(不含控制器),目前已开启预约登记。V社表示系统软件更新后,玩家即可体验,FSR4有望显著提升游戏画质表现。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。