当前位置:

首页 > 业界资讯 > H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

「GPU贫民」即将告别困境!刚刚,英伟达发布了一款名为TensorRT-LLM的开源软件,可以加速在H100上运行的大型语言模型的推理过程那么,具体能提升多少倍?在添加了TensorRT-LLM及其一系列优化功能后(包括In-Flight批处理),模型总吞吐量提升8倍。使用和不使用TensorRT-LLM的GPT-J-6BA100与H100的比较另外,以Llama2为例,相比独立使用A100,TensorRT-LLM能够将推理性能提升4.6倍对比Llama270B、A100和H100在使用和不使用Tens

「GPU贫民」即将告别困境!

刚刚,英伟达发布了一款名为TensorRT-LLM的开源软件,可以加速在H100上运行的大型语言模型的推理过程

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

那么,具体能提升多少倍?

在添加了TensorRT-LLM及其一系列优化功能后(包括In-Flight批处理),模型总吞吐量提升8倍。

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

使用和不使用TensorRT-LLM的GPT-J-6B A100与H100的比较

另外,以Llama 2为例,相比独立使用A100,TensorRT-LLM能够将推理性能提升4.6倍

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

对比Llama 2 70B、A100和H100在使用和不使用TensorRT-LLM的情况下的比较

网友表示,超强H100,再结合上TensorRT-LLM,无疑将彻底改变大型语言模型推理现状!

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

TensorRT-LLM:大模型推理加速神器

当前,由于大模型有着巨大的参数规模,使得「部署和推理」难度和成本一直居高不下。

英伟达开发的TensorRT-LLM旨在通过GPU来显著提高LLM的吞吐量,并降低成本

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

具体而言,TensorRT-LLM将TensorRT的深度学习编译器、FasterTransformer的优化内核、预处理和后处理以及多GPU/多节点通信封装在一个简单的开源Python API中

英伟达对FasterTransformer进行了进一步的增强,使其成为一个产品化的解决方案。

可见,TensorRT-LLM提供了一个易用、开源和模块化的Python应用编程接口。

不需要深入了解C++或CUDA专业知识的码农们,可以部署、运行和调试各种大型语言模型,并且能够获得卓越的性能表现,以及快速定制化的功能

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

根据英伟达官方博客的报道,TensorRT-LLM采用了四种方法来提升Nvidia GPU上的LLM推理性能

首先,为当前10+大模型,引入TensorRT-LLM,让开发者们能够立即运行。

其次,TensorRT-LLM作为一个开源软件库,允许LLM在多个GPU和多个GPU服务器上同时进行推理。

这些服务器分别通过,英伟达的NVLink和InfiniBand互连连接。

第三点是关于「机内批处理」,这是一项全新的调度技术,它允许不同模型的任务独立于其他任务进入和退出GPU

最后,TensorRT-LLM经过优化,可以利用H100 Transformer Engine来降低模型推理时的内存占用和延迟。

下面我们来详细看一下TensorRT-LLM是如何提升模型性能的

支持丰富LLM生态

TensorRT-LLM为开源模型生态提供了出色的支持

需要重写的内容是:具有最大规模和最先进的语言模型,例如Meta推出的Llama 2-70B,需要多个GPU协同工作才能实时提供响应

以前,要实现LLM推理的最佳性能,开发人员必须手动重写AI模型,并将其分解成多个片段,然后在GPU之间进行协调执行

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

TensorRT-LLM使用张量并行技术,将权重矩阵分配到各个设备上,从而简化了这一过程,可以实现大规模高效推理

每个模型可以在通过NVLink连接的多个GPU和多个服务器上并行运行,无需开发人员干预或模型更改。

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

随着新模型和模型架构的推出,开发人员可以使用TensorRT-LLM中开源的最新NVIDIA AI内核(Kernal)来优化模型

需要进行改写的内容是:支持的内核融合(Kernal Fusion)包括最新的FlashAttention实现,以及用于GPT模型执行的上下文和生成阶段的掩码多头注意力等

此外,TensorRT-LLM还包括了目前流行的许多大语言模型的完全优化、可立即运行的版本。

这些模型包括Meta Llama 2、OpenAI GPT-2和GPT-3、Falcon、Mosaic MPT、BLOOM等十多个。所有这些模型都可以使用简单易用的TensorRT-LLM Python API来调用

这些功能可帮助开发人员更快、更准确地搭建定制化的大语言模型,以满足各行各业的不同需求。

In-flight批处理

现如今大型语言模型的用途极其广泛。

一个模型可以同时用于多种看起来完全不同的任务——从聊天机器人中的简单问答响应,到文档摘要或长代码块的生成,工作负载是高度动态的,输出大小需要满足不同数量级任务的需求。

任务的多样性可能会导致难以有效地批处理请求和进行高效并行执行,可能会导致某些请求比其他请求更早完成。

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

为了管理这些动态负载,TensorRT-LLM包含一种称为「In-flight批处理」的优化调度技术。

大语言模型的核心原理在于,整个文本生成过程可以通过模型的多次迭代来实现

通过in flight批处理,TensorRT-LLM运行时会立即从批处理中释放出已完成的序列,而不是等待整个批处理完成后再继续处理下一组请求。

在执行新请求时,上一批还未完成的其他请求仍在处理中。

通过进行机上批处理和进行额外的内核级优化,可以提高GPU的利用率,从而使得H100上LLM的实际请求基准的吞吐量至少增加一倍

使用FP 8的 H100 Transformer引擎

TensorRT-LLM还提供了一个名为H100 Transformer Engine的功能,能有效降低大模型推理时的内存消耗和延迟。

因为LLM包含数十亿个模型权重和激活函数,通常用FP16或BF16值进行训练和表示,每个值占用16位内存。

然而,在推理时,大多数模型可以使用量化(Quantization)技术以较低精度有效表示,例如8位甚至4位整数(INT8或 INT4)。 

量化(Quantization)是在不牺牲准确性的情况下降低模型权重和激活精度的过程。使用较低的精度意味着每个参数较小,并且模型在GPU内存中占用的空间较小。

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

这样做可以使用相同的硬件对更大的模型进行推理,同时在执行过程中减少在内存操作上的时间消耗

通过H100 Transformer Engine技术,配合TensorRT-LLM的H100 GPU使户能够轻松地将模型权重转换为新的FP8格式,并能自动编译模型以利用优化后的FP8内核。

而且这个过程不需要任何的代码!H100引入的FP8数据格式使开发人员能够量化他们的模型并从大幅度减少内存消耗,而且不会降低模型的准确性。

与INT8或INT4等其他数据格式相比,FP8量化保留了更高的精度,同时实现了最快的性能,并且实现起来最为方便。 与INT8或INT4等其他数据格式相比,FP8量化保留了更高的精度,同时实现了最快的性能,并且实现起来最为方便

如何获取TensorRT-LLM

尽管TensorRT-LLM尚未正式发布,但用户现在已经可以提前体验了

申请链接如下:

https://developer.nvidia.com/tensorrt-llm-early-access/join

英伟达也说会将TensorRT-LLM很快集成到NVIDIA NeMo框架中。

这个框架是最近由英伟达推出的AI Enterprise的组成部分,为企业客户提供了一个安全、稳定、可管理性极强的企业级AI软件平台

开发人员和研究人员可以通过英伟达NGC上的NeMo框架或GitHub上的项目来访问TensorRT-LLM

但是需要注意的是,用户必须注册英伟达开发者计划才能申请抢先体验版本。

网友热议

Reddit上的用户对TensorRT-LLM的发布进行了激烈的讨论

难以想象专门针对LLM对硬件做出优化之后,效果将会有多大的提升。

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

但也有网友认为,这个东西的意义就是帮助老黄卖更多的H100。

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

有些网友对此持不同意见,他们认为Tensor RT对于本地部署深度学习的用户也是有帮助的。只要拥有RTX GPU,将来在类似的产品上也有可能受益

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

从更宏观的角度来看,也许对于LLM而言,会出现一系列专门针对硬件级别的优化措施,甚至可能会出现专门为LLM设计的硬件来提升其性能。这种情况在许多流行的应用中已经出现过,LLM也不会例外

H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型


本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型
相关文章 更多
英伟达推出NVHBM:定制HBM带宽提升30%并扩展NVLink Fusion生态
英伟达推出NVHBM:定制HBM带宽提升30%并扩展NVLink Fusion生态

英伟达发布定制HBM技术NVHBM,通过集成内存控制器至HBM基础裸片,实现带宽较HBM4E提升30%、功耗降低15%,并释放主芯片25%空间。亚马逊Annapurna Labs为首个合作伙伴,该技术旨在通过标准化方案加速定制AI芯片开发,而非取代通用HBM。

英伟达 RTX PRO 6000 Blackwell 全线涨价 较去年首发价高出 55%
英伟达 RTX PRO 6000 Blackwell 全线涨价 较去年首发价高出 55%

英伟达RTXPRO6000Blackwell官方标价升至13250美元,较首发价8565美元上涨55%。受显存市场紧绷及AI需求升温影响,专业显卡价格持续走高,折射出高端GPU市场供需格局演变。

英伟达未发布的 RTX 2080 Ti SUPER 显卡首次曝光:拥有 4608 个 CUDA 核心与 12GB 显存 规格直逼 Titan RTX
英伟达未发布的 RTX 2080 Ti SUPER 显卡首次曝光:拥有 4608 个 CUDA 核心与 12GB 显存 规格直逼 Titan RTX

英伟达未发布的RTX2080TiSUPER工程样品现身eBay,配备4608个CUDA核心、12GB显存及384-bit位宽,规格接近TitanRTX。该卡因性能与定价内斗被取消,需在测试模式下修改驱动方可使用。

高管将访问英伟达总部讨论实体AI  LG旗下股票大涨
高管将访问英伟达总部讨论实体AI LG旗下股票大涨

近日,LG旗下多家子公司高管将集体访问英伟达总部,探讨实体人工智能与机器人领域合作。此前董事长已与黄仁勋会面。此消息推动LG电子、LGCNS等公司股价出现上涨。

英伟达统治超算榜单:TOP500占81%
英伟达统治超算榜单:TOP500占81%

英伟达在TOP500超算中占据81%份额,新上榜系统近90%采用其技术。AI训练吞吐量是其他平台总和两倍以上,推理吞吐量近三倍。Green500前八名均搭载英伟达GPU,GraceCPU系统增至26台,欧洲正开发35台英伟达AI超算。

UOS系统英伟达显卡驱动怎么安装
UOS系统英伟达显卡驱动怎么安装

在统信UOS系统中,若要安装NVIDIA显卡驱动,有以下三种方式:一是利用图形化驱动管理器,一键启用即可自动禁用nouveau并重启lightdm;二是通过APT最新源来安装适配驱动,在此之前需先清除残留,再执行sudo apt install nvidia-driver命令;三是手动安装.run驱

339.99 美元:技嘉 RTX 3060 12GB 显卡在美国重新上架 比 2021 年首发贵 10 美元
339.99 美元:技嘉 RTX 3060 12GB 显卡在美国重新上架 比 2021 年首发贵 10 美元

技嘉RTX306012GB显卡在美重新上架,售价339.99美元,比首发价贵10美元。WindforceRev2.0版参数不变。华硕也在欧洲铺货,两家同步动作引发RTX50系列供货困境猜测。

英伟达被曝不提供免费零食咖啡 黄仁勋崇尚节俭
英伟达被曝不提供免费零食咖啡 黄仁勋崇尚节俭

英伟达不提供免费零食咖啡,公司餐厅仅部分补贴,普通咖啡免费但特饮自费。没有乒乓球桌、健身房等休闲设施,副总裁出差坐经济舱且无专属助理。创始人黄仁勋崇尚节俭,倡导专注业务。这种务实文化助力公司市值屡创新高。

Valar 利用先进反应堆为英伟达 Blackwell 芯片提供核能支持
Valar 利用先进反应堆为英伟达 Blackwell 芯片提供核能支持

美国核能初创企业瓦拉原子能公司成功利用先进反应堆为英伟达Blackwell芯片供电,这是美国下一代反应堆首次实现。双方计划在犹他州共建小型数据中心,验证AI设施通过核能与闭环液冷技术实现自给自足。

原价8299元!RTX 5080公版国内限量开抢
原价8299元!RTX 5080公版国内限量开抢

英伟达在BilibiliWorld2026设立体验站,限量发售RTX5080公版显卡,售价8299元。玩家需通过在线预约、现场打卡或任务互动获取必购券,每UID限兑一次。现场持券可获京东必购码下单。活动持续三天,售完即止。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。