当前位置:

首页 > 软件教程 > TPU 与 GPU:真实世界的性能和速度差异

TPU 与 GPU:真实世界的性能和速度差异

在本文中,我们将进行TPU与GPU的比较。但在我们深入研究之前,这是你必须知道的。机器学习和人工智能技术加速了智能应用的发展。为此,半导体公司不断创建加速器和处理器,包括TPU和CPU,以处理更复杂的应用程序。一些用户在理解何时建议使用TPU以及何时使用GPU来完成他们的计算机任务时遇到了问题。GPU也称为图形处理单元,是您PC的视频卡,可为您提供视觉和身临其境的PC体验。例如,如果您的PC未检测到GPU,您可以按照简单的步骤操作。为了更好地理解这些情况,我们还需要澄

在本文中,我们将进行 TPU 与 GPU 的比较。但在我们深入研究之前,这是你必须知道的。

机器学习和人工智能技术加速了智能应用的发展。为此,半导体公司不断创建加速器和处理器,包括 TPU 和 CPU,以处理更复杂的应用程序。

一些用户在理解何时建议使用 TPU 以及何时使用 GPU 来完成他们的计算机任务时遇到了问题。

GPU 也称为图形处理单元,是您 PC 的视频卡,可为您提供视觉和身临其境的 PC 体验。例如,如果您的PC 未检测到 GPU ,您可以按照简单的步骤操作。

为了更好地理解这些情况,我们还需要澄清什么是 TPU 以及它与 GPU 的比较。

什么是 TPU?

TPU 或张量处理单元是用于特定应用的专用集成电路 (IC),也称为 ASIC(专用集成电路)。Google 从头开始​​创建 TPU,于 2015 年开始使用,并于 2018 年向公众开放。

TPU 与 GPU:真实世界的性能和速度差异

TPU 作为次要芯片或云版本提供。为了使用 TensorFlow 软件加速神经网络的机器学习,云 TPU 以惊人的速度解决复杂的矩阵和向量运算。

借助 TensorFlow,Google Brain 团队开发了一个开源机器学习平台,研究人员、开发人员和企业可以使用 Cloud TPU 硬件构建和操作 AI 模型。

在训练复杂且稳健的神经网络模型时,TPU 会缩短达到准确值的时间。这意味着使用 GPU 训练可能需要数周时间的深度学习模型所花费的时间不到这一时间的一小部分。

TPU 和 GPU 一样吗?

它们在架构上是高度不同的。图形处理单元本身就是一个处理器,尽管它是通过管道传输到矢量化数值编程的。GPU 实际上是下一代 Cray 超级计算机。

TPU 是不自己执行指令的协处理器;代码在 CPU 上执行,它为 TPU 提供小操作流。

我什么时候应该使用 TPU?

云中的 TPU 是针对特定应用程序量身定制的。在某些情况下,您可能更喜欢使用 GPU 或 CPU 执行机器学习任务。一般来说,以下原则可以帮助您评估 TPU 是否是您工作负载的最佳选择:

  • 矩阵计算在模型中占主导地位
  • 在模型的主训练循环中,没有自定义 TensorFlow 操作
  • 他们是经过数周或数月训练的模特
  • 它们是具有广泛、有效批量大小的大型模型。

现在让我们直接进行 TPU 与 GPU 的比较。

GPU和TPU有什么区别?

TPU 与 GPU 架构

TPU 不是高度复杂的硬件,感觉就像是用于雷达应用的信号处理引擎,而不是传统的 X86 衍生架构。

尽管有许多矩阵乘法除法,但它更像是一个协处理器而不是 GPU;它仅执行主机收到的命令。

由于要输入到矩阵乘法组件的权重太多,因此 TPU 的 DRAM 作为单个单元并行运行。

此外,由于 TPU 只能进行矩阵运算,因此 TPU 板与基于 CPU 的主机系统相连,以完成 TPU 无法处理的任务。

主机负责将数据传送到 TPU、预处理以及从云存储中获取详细信息。

TPU 与 GPU:真实世界的性能和速度差异

GPU 更关心应用可用内核来工作,而不是访问低延迟缓存。

许多具有多个 SM(流式多处理器)的 PC(处理器集群)成为单个 GPU 小工具,每个 SM 中都包含第一层指令缓存层和随附的内核。

在从全局 GDDR-5 内存中提取数据之前,一个 SM 通常使用两个缓存的共享层和一个缓存的专用层。GPU 架构可以容忍内存延迟。

GPU 以最少数量的内存缓存级别运行。但是,由于 GPU 具有更多专用于处理的晶体管,因此它不太关心访问内存中数据的时间。

由于 GPU 一直被足够的计算占用,可能的内存访问延迟被隐藏了。

TPU 与 GPU 速度

这个原始的 TPU 生成有针对性的推理,它使用学习模型而不是训练模型。

在使用神经网络推理的商业 AI 应用程序上,TPU 比当前的 GPU 和 CPU 快 15 到 30 倍。

此外,TPU 非常节能,TOPS/Watt 值增加了 30 到 80 倍。

专家提示:某些 PC 问题很难解决,尤其是在存储库损坏或 Windows 文件丢失时。如果您在修复错误时遇到问题,则您的系统可能已部分损坏。我们建议安装 Restoro,这是一种可以扫描您的机器并确定故障所在的工具。
单击此处下载并开始修复。

因此,在进行 TPU 与 GPU 速度比较时,可能性偏向于张量处理单元。

TPU 与 GPU:真实世界的性能和速度差异

TPU 与 GPU 性能

TPU 是一种张量处理机器,旨在加速 Tensorflow 图计算。

在一块板上,每个 TPU 可提供高达 64 GB 的高带宽内存和 180 teraflops 的浮点性能。

Nvidia GPU 和 TPU 之间的比较如下所示。Y 轴表示每秒的照片数量,而 X 轴表示各种型号。

TPU 与 GPU:真实世界的性能和速度差异

TPU 与 GPU 机器学习

以下是使用不同批量大小和每个 Epoch 迭代的 CPU 和 GPU 的训练时间:

  • 迭代次数/时期:100,批量大小:1000,总时期:25,参数:1.84 M,模型类型:Keras Mobilenet V1(alpha 0.75)。
加速器GPU (英伟达 K80)热塑性聚氨酯
训练准确率 (%)96.594.1
验证准确率 (%)65.168.6
每次迭代的时间(毫秒)69173
每个时代的时间 (s)69173
总时间(分钟)3072
  • Iterations/epoch: 1000, Batch size: 100, Total epochs: 25, Parameters: 1.84 M, and Model type: Keras Mobilenet V1 (alpha 0.75)
加速器GPU (英伟达 K80)热塑性聚氨酯
训练准确率 (%)97.496.9
验证准确率 (%)45.245.3
每次迭代的时间(毫秒)185252
每个时代的时间 (s)1825
总时间(分钟)1621

从训练时间可以看出,使用较小的批大小,TPU 需要更长的训练时间。但是,随着批量大小的增加,TPU 性能更接近 GPU。

因此,在进行 TPU 与 GPU 训练比较时,很大程度上与时期和批量大小有关。

TPU 与 GPU 基准测试

凭借 0.5 瓦/TOPS,单个 Edge TPU 每秒可以执行 4 万亿次操作。有几个变量会影响这转化为应用程序性能的程度。

神经网络模型有不同的要求,整体输出取决于 USB 加速器设备的主机 USB 速度、CPU 和其他系统资源。

考虑到这一点,下图对比了使用各种标准模型在 Edge TPU 上进行单一推理所花费的时间。当然,为了比较,所有运行的模型都是 TensorFlow Lite 版本。

TPU 与 GPU:真实世界的性能和速度差异

请注意,上面的给定数据显示了运行模型所需的时间。但是,它不包括处理输入数据所需的时间,这因应用程序和系统而异。

将 GPU 基准测试的结果与用户期望的游戏质量设置和分辨率进行比较。

基于对超过 70,000 个基准测试的评估,我们精心构建了复杂的算法,以生成 90% 的游戏性能可靠估计。

尽管显卡的性能因游戏而异,但下面这张比较图给出了一些显卡的广泛评级指数。

TPU 与 GPU:真实世界的性能和速度差异

TPU 与 GPU 价格

他们有很大的价格差异。TPU 的成本是 GPU 的五倍。这里有些例子:

  • Nvidia Tesla P100 GPU 每小时 1.46 美元
  • Google TPU v3 每小时收费 8.00 美元
  • 具有 GCP 按需访问的 TPUv2 每小时 4.50 美元

如果以优化成本为目标,那么只有当 TPU 训练模型的速度是 GPU 的 5 倍时,您才应该选择 TPU。

CPU、GPU 和 TPU 有什么区别?

TPU、GPU 和 CPU 之间的区别在于 CPU 是一种非特定用途的处理器,它处理计算机的所有计算、逻辑、输入和输出。

另一方面,GPU 是一个额外的处理器,用于改进图形界面 (GI) 并进行高端活动。TPU 是强大的特制处理器,用于执行使用特定框架(例如 TensorFlow)开发的项目。

我们将它们分类如下:

  • 中央处理器 (CPU) – 控制计算机的所有方面
  • 图形处理单元 (GPU) – 提高计算机的图形性能
  • 张量处理单元 (TPU) – 专为 TensorFlow 项目设计的 ASIC
TPU 与 GPU:真实世界的性能和速度差异

英伟达制造 TPU 吗?

很多人都想知道 NVIDIA 会如何应对 Google 的 TPU,但我们现在有了答案。

NVIDIA 并没有担心,而是成功地将 TPU 重新定位为可以在有意义时使用的工具,但仍保持其 CUDA 软件和 GPU 处于领先地位。

它通过使技术开源来保持物联网机器学习采用的控制点。然而,这种方法的危险在于,它可能会为一个可能对 NVIDIA 数据中心推理引擎的长期目标构成挑战的概念提供依据。

GPU或TPU更好吗?

总之,我们必须说,尽管开发能够有效使用 TPU 的算法需要额外的成本,但减少的训练成本通常超过额外的编程费用。

选择 TPU 的其他原因包括 v3-128 8 的显存 G 超过了 Nvidia GPU,这使得 v3-8 成为处理与 NLU 和 NLP 相关的大型数据集的更好选择。

更高的速度还可能导致开发周期中的迭代更快,从而导致更快和更频繁的创新,增加市场成功的可能性。

TPU 在创新速度、易用性和可负担性方面优于 GPU;消费者和云架构师应该在他们的 ML 和 AI 计划中考虑 TPU。

谷歌的 TPU 有足够的处理能力,用户必须协调数据输入以确保没有过载。

有了它,TPU 与 GPU 的总比较。我们很想知道您的想法,看看您是否做过任何测试,以及您在 TPU 和 GPU 上收到的结果。

请记住,您可以使用任何适用于 Windows 11 的最佳显卡享受身临其境的 PC 体验。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
软件教程
相关文章 更多
AE基础教程:如何创建合成并制作关键帧动画
AE基础教程:如何创建合成并制作关键帧动画

本文指导After Effects新手完成从打开软件到制作简单动画的完整流程。内容涵盖新建合成、导入素材、添加关键帧及预览验证,适用于AE基础学习。读者可依据步骤快速完成首个可播放的动效项目。

电影剪辑实战:镜头组织、节奏控制与声音衔接技巧
电影剪辑实战:镜头组织、节奏控制与声音衔接技巧

本文详解电影剪辑核心流程,从素材整理、镜头空间组织到叙事节奏压缩,再到J-cut/L-cut声音衔接技巧。通过粗剪保逻辑、精剪压停顿、反应镜头缓冲及电平统一检查,帮助创作者打造空间清晰、情绪连贯且听感自然的成片。

转场剪辑实战指南:硬切、遮挡与运镜的精准选择与操作技巧
转场剪辑实战指南:硬切、遮挡与运镜的精准选择与操作技巧

本文详解硬切、遮挡转场和运镜转场的适用场景与操作逻辑。通过对比三种转场的核心区别,提供基于素材条件和叙事目的的判断标准,帮助剪辑师避免滥用特效,掌握自然衔接画面的实战技巧。

GitLab新手创建项目并推送第一次提交的操作指南
GitLab新手创建项目并推送第一次提交的操作指南

本文指导GitLab新手完成创建项目并推送第一次提交的最小闭环。涵盖远程项目创建、本地仓库初始化、添加远程地址及执行git push。重点说明HTTPS与SSH认证差异、分支名(master/main)核对及提交验证标准,确保远程仓库真正建立。

抖音拍摄剪辑教程:从竖屏运镜到卡点成片
抖音拍摄剪辑教程:从竖屏运镜到卡点成片

本教程针对抖音竖屏视频制作,涵盖拍摄前构思、稳定运镜、粗剪筛选、音乐卡点及导出检查全流程。重点在于拍摄时预留字幕空间、利用动作节点辅助剪辑,以及通过鼓点对齐画面。适用于新手快速完成第一条完整成片,强调素材质量与节奏自然,避免过度特效与版权风险。

饭圈舞台照修图:降噪、调色与人物突出技巧
饭圈舞台照修图:降噪、调色与人物突出技巧

针对饭圈舞台照光线乱、噪点多、背景抢眼的痛点,本文提供“保脸、控光、突出主体”的修图方案。核心步骤包括:利用Lightroom降噪面板处理高ISO颗粒,控制曝光避免高光死白或脸部死黑;通过压低背景色彩、提升人物亮度与对比度来修正舞台灯光导致的肤色偏差;最后通过裁剪去除杂乱元素,确保人物主体清晰且肤色自然。

Photoshop安装失败或启动异常:系统要求、安装流程与故障排查指南
Photoshop安装失败或启动异常:系统要求、安装流程与故障排查指南

本文提供Photoshop完整安装指南,涵盖Windows/macOS系统要求、Creative Cloud客户端部署及常见启动故障排查。通过安装前磁盘与账号检查、安装中网络监控、安装后功能测试三步法,解决安装中断、登录失败及启动卡顿问题,确保软件稳定可用。

创维电视通过U盘安装第三方软件完整教程:权限设置与故障排查
创维电视通过U盘安装第三方软件完整教程:权限设置与故障排查

本文提供创维电视通过U盘安装第三方APK的完整操作指南。核心步骤包括:准备格式化的U盘与正规APK文件,在酷开系统“应用管理”中找到安装入口,临时开启“允许安装未知来源应用”权限,以及安装后的功能测试与权限关闭。适用于解决电视无法识别U盘、提示解析失败或权限受限等问题,确保安装安全且不影响系统稳定。

Excel筛选大于指定数值:操作步骤与结果验证
Excel筛选大于指定数值:操作步骤与结果验证

本教程演示如何在Excel中筛选大于指定数值的数据。核心步骤包括:确保数据连续、选中表头、通过“开始→排序和筛选”开启筛选,并在“数字筛选”中选择“大于”输入阈值。筛选仅隐藏不符合条件的行,不删除数据。完成后需逐行验证可见数据是否均大于阈值,并可通过取消筛选恢复全部数据。

Creo零基础入门:新建零件与第一次拉伸建模完整指南
Creo零基础入门:新建零件与第一次拉伸建模完整指南

本教程指导Creo初学者完成首个拉伸实体建模。通过新建零件、选择mmns_part_solid模板、定义草绘平面及绘制封闭轮廓,生成三维实体。内容涵盖操作路径、参数设置及常见错误排查,帮助新手建立正确的建模逻辑与单位概念。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。