当前位置:

首页 > 业界资讯 > 顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

近几年自然语言处理的进展很大程度上都来自于大规模语言模型,每次发布的新模型都将参数量、训练数据量推向新高,同时也会对现有基准排行进行一次屠榜!比如今年4月,Google发布5400亿参数的语言模型PaLM(PathwaysLanguageModel)在语言和推理类的一系列测评中成功超越人类,尤其是在few-shot小样本学习场景下的优异性能,也让PaLM被认为是下一代语言模型的发展方向。同理,视觉语言模型其实也是大力出奇迹,可以通过提升模型的规模来提升性能。当然了,如果只是多任务的视觉语言模型,显然还

近几年自然语言处理的进展很大程度上都来自于大规模语言模型,每次发布的新模型都将参数量、训练数据量推向新高,同时也会对现有基准排行进行一次屠榜!

比如今年4月,Google发布5400亿参数的语言模型PaLM(Pathways Language Model)在语言和推理类的一系列测评中成功超越人类,尤其是在few-shot小样本学习场景下的优异性能,也让PaLM被认为是下一代语言模型的发展方向。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

同理,视觉语言模型其实也是大力出奇迹,可以通过提升模型的规模来提升性能。

当然了,如果只是多任务的视觉语言模型,显然还不是很通用,还得支持多种语言的输入输出才行。

最近Google就将PaLM扩展升级成PALI(Pathways Language and Image model),兼具多语言和图像理解的能力,同时支持100+种语言来执行各种横跨视觉、语言和多模态图像和语言应用,如视觉问题回答、图像说明(image caption)、物体检测、图像分类、OCR、文本推理等。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

论文链接:​https://arxiv.org/abs/2209.06794​

模型的训练使用的是一个公开的图像集合,其中包括自动爬取的109种语言的标注,文中也称之为WebLI数据集。

在WebLI上预训练的PaLI模型在多个图像和语言基准上取得了最先进的性能,如COCO-Captions、TextCaps、VQAv2、OK-VQA、TextVQA等等,也超越了先前模型的多语言视觉描述(multilingual visual captioning)和视觉问答的基准。

模型架构

PALI的目标之一是研究语言视觉模型在性能和规模上的联系是否相同,特别是语言-图像模型的可扩展性(scalability)。

所以模型的架构设计上就很简单,主要是为了实验方便,尤其是可重复使用且可扩展。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

模型由一个处理输入文本的Transformer编码器和一个生成输出文本的自回归Transformer解码器组成。

在处理图像时,Transformer编码器的输入还包括代表由ViT处理的图像的视觉词(visual words)。

PaLI模型的一个关键设计是重用,研究人员用之前训练过的单模态视觉和语言模型(如mT5-XXL和大型ViTs)的权重作为模型的种子,这种重用不仅使单模态训练的能力得到迁移,而且还能节省计算成本。

模型的视觉组件使用的是迄今为止最大的ViT架构ViT-e,它与18亿参数的ViT-G模型具有相同的结构,并使用相同的训练参数,区别就是扩展为了40亿参数

虽然在视觉领域和语言领域都对缩放规律进行了研究,但在视觉和语言的组合模型中对缩放行为的探讨较少,扩大视觉骨干模型的规模可能会导致在分类任务中的收益饱和。

研究人员也进一步证实了这一点,可以观察到 ViT-e在ImageNet上只比ViT-G好一点,但ViT-e在PaLI的视觉语言任务上有很大的改进。例如,ViT-e在COCO字幕任务上比ViT-G多出近3个CIDEr点。任务上比ViT-G多出3分。这也暗示了未来在视觉语言任务中使用更大的ViT骨架模型的空间。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

研究人员采用mT5骨干作为语言建模组件,使用预训练的mT5-Large(10亿参数)和mT5-XXL (130亿参数)来初始化PaLI的语言编码器-解码器,然后在许多语言任务中进行继续混合训练,包括纯语言理解任务,这也有助于避免灾难性的遗忘mT5的语言理解和生成能力。

最后得到了三个不同尺寸的PALI模型。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

109种语言的数据集

深度学习相关的扩展研究表明,模型越大,所需的训练数据集也越大。

所以为了全面研究和释放语言-图像预训练模型的潜力,研究人员从互联网上爬取了大量的图像和文本数据,构建了一个全新的数据集WebLI,其中包括109种语言的120亿alt-texts和100亿张图片。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

除了用网络文本进行标注外,研究人员还应用云端视觉API对图像进行OCR识别,进而得到290亿个图像-OCR的数据对。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

使用near-duplication对68个常见的视觉和视觉语言数据集的训练、验证和测试部分的图像进行了去重处理,以避免下游评估任务的数据泄露。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

为了进一步提高数据质量,研究人员还会根据「图像和alt-text」的跨模态相似度进行评分,并调整阈值,最后只保留10%的图像,总共有10亿张图像用于训练PaLI

训练大模型

由于视觉-语言任务是多模态,所以需要模型具有多种语义处理能力,而且会有不同的目标。比如有些任务需要对物体进行局部定位以准确解决任务,而其他一些任务可能需要更多的全局语义信息。

同样地,有的语言任务可能需要长的答案,而有些则需要紧凑的答案。

为了解决所有这些不一致的目标,研究人员利用WebLI预训练数据的丰富性,引入预训练任务的混合(Pretraining Task Mixture),为各种下游应用准备模型。

为了让模型更通用以解决多种任务,作者将所有的任务归入一个单一的通用API(输入:图像+文本;输出:文本),使多个图像和语言任务之间能够进行知识共享,这也是与预训练设置的共享。

用于预训练的目标作为加权的混合被投影到同一个API中,目的是既保持重复使用的模型组件的能力,又能训练模型执行新的任务。

模型使用开源的T5X和Flaxformer框架在JAX中用Flax进行训练,视觉部分的ViT-e使用开源的BigVision框架,将语言部分的词向量与视觉部分生成的patch向量级联起来,共同作为多模态编码器-解码器的输入,编码器使用mT5-XXL预训练初始化。在PaLI的训练过程中,视觉组件的权重被冻结,只更新多模态编码器-解码器的权重。

在实验部分,研究人员在常见的视觉语言基准上对PaLI进行了比较,且PaLI模型在这些任务上取得了最先进的结果,甚至超过了以往文献中提出的超大型的模型。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

比如170亿参数的PALI在一些VQA和图像标题任务上的表现优于800亿参数的Flamingo模型。

并且PALI在单语言或单视觉的任务上也保持了良好的表现,虽然这并非是PALI主要的训练目标。

文中还研究了图像和语言模型组件在模型扩展方面是如何相互作用的,以及模型在哪里产生最大的收益。

最后得出的结论是,对这两个组件进行联合扩展(缩放)会产生最好的性能,具体来说,对需要相对较少参数的视觉组件进行缩放是最关键的,同时缩放对于提高多语言任务的性能也很重要。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

在35种语言的基准Crossmodal-3600上评估了PaLI后可以发现多语言起标题任务从PaLI模型的扩展中受益更多。

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

为了避免在大型语言和图像模型中产生或加强不公平的偏见,需要对所使用的数据和模型如何使用这些数据保持透明,以及测试模型的公平性并进行负责任的数据分析,所以文中同时提供了一个Data Card和Model Card

顺手训了一个史上超大ViT?Google升级视觉语言模型PaLI:支持100+种语言

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 Google
相关文章 更多
watchstore下载软件教程:设备兼容、安装流程与常见故障
watchstore下载软件教程:设备兼容、安装流程与常见故障

本文详解watchstore下载软件流程:先确认Apple Watch/Wear OS/国产品牌手表的系统兼容性与蓝牙配对,再经手机端应用商店查找并安装至指定设备。重点涵盖安装后手表端验证、权限设置及“设备不兼容”“等待安装”“找不到应用”等故障排查,确保软件在手表端正常运行。

清华、慕尼黑工大等高校联手:让AI扩散语言模型学会
清华、慕尼黑工大等高校联手:让AI扩散语言模型学会"回忆未来"

多家机构联合提出d-OPSD方法,通过让扩散语言模型的学生生成未来答案,并让老师利用这些未来信息进行指导,实现了步级别密集监督。在四项推理任务上,该方法达到同等效果仅需约十分之一的训练步数,显著提升了训练效率。

小摩:料中国主要大型语言模型ARR今年增长约4至7倍
小摩:料中国主要大型语言模型ARR今年增长约4至7倍

摩根大通研报预测,中国主要大语言模型厂商年度经常性收入在2026年将增长4至7倍,基于价值导向的定价策略与性价比竞争推动全球份额提升,但需关注货币化可持续性与定价能力。

慕尼黑大学等联合研究揭示大语言模型中层激活如何暴露恶意提示
慕尼黑大学等联合研究揭示大语言模型中层激活如何暴露恶意提示

慕尼黑大学等机构研究发现,通过分析大语言模型中间层的预测熵变化趋势可有效检测越狱攻击。越狱提示词会使熵呈单调变化,而安全提示词则随机波动,该信号在中间层最强,无需额外训练,但需访问模型内部激活。

大语言模型的
大语言模型的"内心独白"到底有没有真正在思考?

不列颠哥伦比亚大学研究团队提出四条公理评估大语言模型的内部潜在思维表示质量。对五个开源模型检测发现,当前方法在因果性、最小性、可分性上表现不佳,任务内可分性近乎随机猜测,存在结构性缺陷,表明潜在思考多为“表演”而非真正推理。

谷歌手机浏览器怎么退出无痕模式  googlechrome怎样关闭无痕模式
谷歌手机浏览器怎么退出无痕模式 googlechrome怎样关闭无痕模式

谷歌浏览器的无痕浏览模式怎么关闭呢?开启谷歌浏览器的无痕浏览模式后,在此期间的浏览器操作将不会留下任何痕迹,包括历史记录、账号密码和搜索记录等。不过,它并不像洋葱浏览器那样强大到连IP地址都无法被追踪,所以大家上网还是要遵守法律法规哦。首先我们打开浏览器,可以看到浏览器右上方关闭按钮下方有一个菜单按

谷歌翻译官网网页版入口地址
谷歌翻译官网网页版入口地址

多语种覆盖能力 首先,它支持超过100种语言之间的即时互译,从全球主流语系到冰岛语、拉脱维亚语这类区域性小语种,都能找到对应方案,覆盖范围相当广泛。对于不确定源语言的情况,系统自带的语种自动识别功能就派上了大用场,粘贴文本后瞬间就能判定语种并启动翻译,操作门槛极低。 面对德语、法语、日语这些语法结构

谷歌浏览器如何翻译整个网页
谷歌浏览器如何翻译整个网页

用好浏览器自带翻译,跨语言浏览其实很简单 浏览外文网站时,语言不通确实是道坎儿。其实,谷歌浏览器自带了一套相当便捷的翻译方案,能帮你把整个网页变成熟悉的语言,基本上不需要离手浏览器。 (本文操作基于 Dell XPS 13,Windows 11 环境下的谷歌浏览器) 一、最直接的入口:地址栏翻译按钮

google浏览器拓展插件安装
google浏览器拓展插件安装

想在Chrome浏览器里装些好用的小工具,但发现插件来源复杂、操作步骤也不少,是不是有点无从下手?其实,只要搞懂几个核心路径,给Chrome添加新功能这件事,完全可以变得轻松流畅。下面,就为你梳理清楚安装第三方扩展的全套方法。 一、通过Chrome网上应用店安装插件 最稳妥、最省心的方式,自然是走官

googleplay商店 googleplay商店官网
googleplay商店 googleplay商店官网

必须通过https://play.google.com/store/最新入口获取,或用开发者工具提取动态签发的vending APK链接下载v52.4.41版;需预装GMS框架、开启未知来源权限,并在设置中手动启动应用。想在安卓手机上安装正式版Google Play商店,又找不到可靠入口或下载渠道,

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。