当前位置:

首页 > 业界资讯 > 人工智能多模态技术在苹果研发中的最新进展

人工智能多模态技术在苹果研发中的最新进展

译者|布加迪审校|重楼如果我告诉你,在最近热议的多模态AI背后,苹果正在悄然酝酿一场革命,你会作何感想?苹果的一群研究人员一直在系统地研究如何构建功能最强大的多模态模型,揭露了质疑传统智慧的重要见解。现在他们让我们有机会一窥底层的细节。他们的研究工作可能会改变我们对待多模态项目的视角。但要理解其中的原因,你需要搞清楚其研究方法和发现结果的细节。以下是本人对苹果研究论文的解读。本人在这篇文章中将介绍以下内容:他们测试的架构方面的具体取舍以及真正最重要的方面。他们如何以一种非常有意识的方式混合数据来实现最先进

译者 | 布加迪

审校 | 重楼

如果我告诉,在最近热议的多模态AI背后,苹果正悄然酝酿一场革命,会作何感想?苹果的一研究人员一直在系统地研究如何构建功能强大的多模态模型,揭露质疑传统智慧的重要见解。现在他们让我们有机会一窥底层的细节。

苹果研发多模态AI,这是研究人员迄今发现的结果

他们的研究工作可能会改变我们对待多模项目的视角。但要理解其中的原因,需要搞清楚其研究方法和发现结果细节以下是本人对苹果研究论文的解读。

本人在这篇文章中将介绍以下内容:

  • 他们测试的架构方面的具体取舍以及真正重要的方面。
  • 他们如何以一种非常有意识的方式混合数据来实现最先进的小样本(few-shot)学习
  • 为什么他们的扩展定律和训练方法对于任何建立多模态模型的人都至关重要
  • 证明苹果模型的出色功能的具体例子,从多图像推理到OCR
  • 本人对这项研究工作的潜在影响所持的看法,以及它提出的一些开放性问题

本文将给出严谨的技术解读和通俗易懂的主旨概述。最后,对这项开创性的研究以及它如何改变AI未来有一番清晰认识。

引言

多模态AI已经取得了快速发展,FlamingoEMu2MoLLa模型展示了结合视觉和语言理解的潜力。然而,许多这些模型并没有深入地揭示其架构选择和训练过程背后的基本原理。

苹果的MM1论文介绍了一系列多模态AI模型,深入解释了如何构建结合视觉和语言理解的高性能系统。通过广泛的消融研究和系统实验,该团队发现了构建高性能多模态模型方面的关键见解。他们的发现结果揭示了不同架构选择、数据混合策略和扩展方法的相对重要性。

通过分享最先进的小样本学习的配方论文作者们使更广泛的研究社区能够他们的研究工作基础上更有作为。从长远来看,这里开创技术可以推动将视觉和语言理解深度整合新一代基础模型。

本人本文中逐步介绍论文的关键部分,涵盖他们的方法、结果、讨论和结论将解释技术细节,同时提供浅显的主要围绕主旨及其意义。在此过程中,本人将分享自己的分析,并着重介绍这项研究工作提出的一些开放式问题。

技术解释

论文作者着手研究如何构建高性能的多模态语言模型(MLLM)。他们系统地分析了两个关键因素1架构组件,比如图像编码器和视觉语言连接器2预训练中的数据选择。

为了有效地评估设计方面选择,他们使用拥有12亿参数LLM的基本配置。他们通过次修改一个组件,面对VQA和字幕任务评估样本小样本性能的影响来进行消融。

就架构而言,他们测试不同的预训练图像编码器不同的目标、数据和分辨率和视觉语言连接器。视觉语言连接器而言,他们测试了平均池化、注意力池化和一个叫做C-Abstractor的卷积ResNet块。令人惊讶的是,特定的连接器架构对性能几乎没有影响。预训练数据而言,他们结合使用带字幕的图像、交错的图像-文本文档和纯文本数据。

结果

苹果研发多模态AI,这是研究人员迄今发现的结果

1. MM1可以跨图像执行指令和推理。来自VILA的示例和图像在思维链的提示下,VILA正确回答

FlamingoIDEFICSEMu2相比,最终的MM1系列可扩展至300亿个参数,在关键基准测试中获得了SOTA小样本测试结果。

至于架构方面,研究人员发现按重要性排序):

  1. 图像分辨率具有最大的影响,从224px到336px有3%的提升
  2. 图像编码器大小和预训练数据也很重要,从ViT-L到ViT-H提升幅度小于1%
  3. 视觉语言连接器设计选择的影响可以忽略不计

至于预训练数据方面:

  • 错数据对于小样本和纯文本性能至关重要,可以提升10%以上
  • 字幕数据改善零样本明显。
  • 合成字幕帮助小样本(+2-4%)。
  • 仔细混合模态(5:5:1比例的字幕,交错文本)效果最好

与Flamingo、IDEFICS、EMu2相比,最终的MM1模型可扩展到300亿参数,在关键基准测试中获得SOTA小样本结果

论文作者证明了他们在监督微调(SFT获得的训练前见解。MM1表现出令人信服的特性,比如多图像推理、OCR上下文小样本学习。

有意架构和数据选择的MM1配方在扩展带来高性能。论文作者希望这些见解能够适用于具体实现之外的更广泛环境

浅显的解释

要点是苹果的研究人员做了一系列实验,以查明构建理解图像文本的AI模型的最佳方法。

他们测试了不同的模型组件,比如编码图像的部分和连接图像和文本的部分。他们发现有些方面很重要图像分辨率编码器大小/数据,而其他方面其实不重要连接器设计

训练模型时,他们还尝试混合不同类型的数据。比如加字幕的图形、文本和图片混合在一起的文档以及纯文本。关键似乎要有多样性——这有助于模型处理不同的情况,比如描述图像或回答问题。

当他们把这一切结合在一起使模型变得非常大300亿参数时,最擅长从仅仅几个例子中学习。它拥有一些出色的功能,比如针对多个图像进行推理读取图像中的文本,甚至解释自己的输出。

简而言之秘密武器是有意地处理模型组件和训练数据。通过分享这一秘诀,这些研究人员正在为新一代功能强大的多模态AI系统铺平道路。

批判性分析

不妨考虑一下MM1研究工作的几处注意事项和限制

  • 评估基准:论文作者特别指出,当前的评估集以字幕为中心。为此优化的模型可能无法推广到其他多模态任务。我们需要更多样化的基准。
  • 扩展定律将超参数外推到更大的规模有风险。可能会出现小规模测试中并未出现的稳定性问题。在训练大模型时,需要仔细监控。
  • 合成数据虽然合成字幕有帮助,但生成的数据有限制。过度优化可能导致奇怪的失效模式。使用须谨慎。
  • 偏见/公平性:没有分析输出或训练数据中社会偏见。为了负责任的部署,这需要仔细审查,尤其是针对从网上抓取的数据。
  • 硬件访问:消融使用了一个有12亿参数的型号,但最终系统300亿参数。在算力有限的情况下,获得的见解可能不太适用。我们需要研究小模型设计。

论文作者确实承认有改进的余地比如扩展视觉编码器、改进视觉语言桥接迭代评估套件。

除了研究人员承认的局限性外,本人认为关于MM1方法还有一些更深层次的问题值得讨论。比如说严重依赖从抓取数据让人们对训练集的代表性和潜在偏见引发担忧。同样值得考虑的是,这里确定的特定架构选择和扩展定律是否可以推广到视觉和语言之外的其他模,或者扩大到更开放的生成任务。在这个领域参与这些更广泛的辩论将加强这项研究工作的影响。

结论

我们能从苹果的MM1论文中学到什么呢

首先,这篇论文为训练高性能的多模态模型提供了更清晰的路线图。如果深思熟虑架构和数据选择,并认真扩展,我就能发掘出色小样本学习和推理能力。

其次,论文提出了该领域的关键开放问题。我们如何建立全面测试多模技能的基准对于通用模型来说,数据模式和任务的正确组合是什么在保持性能的情况下,我们可以将模型尺寸做得小?

三是,论文为基础多模态模型方面的开放研究确立了新标准。通过详细介绍训练过程和释放消融,作者使业界能够复制和扩展他们的研究工作。这对加快整个行业的进展至关重要。

展望未来,MM1论文有望成为多模态AI研究领域的一重要里程碑。通过为模型设计和训练提供严谨的经验基础,论文为该领域的未来发展奠定了基础。虽然它是否会带来类似于GPT-4的变革性影响还有待观察,但本文给人的见解可以指导研究人员继续推动多模系统的最高性能。当然,实现这潜力将需要持续的努力来利用和扩展这些发现结果,同时也竭力解决上面强调的局限性和开放性问题。

本人而言,我很期待看到这方面会带来怎样的发展。

原文标题:Apple is working on multimodal AI. Here's what they've uncovered so far,作者:Mike Young

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 人工智能
上一篇: 快速搭建Vue文档中的布局组件库方法分享
下一篇: Photoshop快捷键技巧教程 常用命令一览表及图解
相关文章 更多
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

苹果与铠侠签署NAND长期供应协议:3-5年长约与不设价格上限背后的供应链战略
苹果与铠侠签署NAND长期供应协议:3-5年长约与不设价格上限背后的供应链战略

苹果与铠侠签署为期3-5年的NAND闪存长期供应协议,且可能不设价格上限。此举旨在应对AI数据中心需求激增导致的芯片供应紧张,从单纯压价转向确保稳定供货。

中国人民大学AI团队揭开大语言模型的隐藏秘密
中国人民大学AI团队揭开大语言模型的隐藏秘密

一项研究揭示大语言模型在文本嵌入任务中表现平庸的根源:反嵌入矩阵边缘频谱引入高频词偏见。提出的EmbedFilter方法通过滤除该噪声,在MTEB49项任务上显著提升性能,且无需重新训练,兼容多种基线方法。

2026世界人工智能大会倒计时30天:全球首发超300款AI新品
2026世界人工智能大会倒计时30天:全球首发超300款AI新品

2026年世界人工智能大会将于7月17日至20日举办,超过300款人工智能新品全球首发,1400多位嘉宾参会,近140场论坛,展览面积超过10万平方米,促成意向合作金额达162亿元,并且推出首个自主举办的国际顶级人工智能学术会议。

“购物车”里的新动向 勾勒扩内需新图景
“购物车”里的新动向 勾勒扩内需新图景

618”期间,AI全面渗透电商,超百万商家使用AI工具提升效率。政策补贴拉动绿色智能家电及汽车消费,市场回暖。供应链升级实现仓配一体化,时效大幅提升,多链协同激活内需活力。

美颜悖论与文艺作品的“活人感”
美颜悖论与文艺作品的“活人感”

AI生成作品虽完美却缺乏“活人感”,这一悖论贯穿艺术史。《红楼梦》中已批判套路化创作。真正活人感源于创作者内化形式美规律后的即兴发挥与平衡,而非单纯拒绝美化。能否尊重生活细节、容忍碰撞,决定作品是否鲜活,这也是艺术的根本功用。

8部门发文加快“人工智能+消费”:服务领域是重点 鼓励适度超前布局城市智能设施
8部门发文加快“人工智能+消费”:服务领域是重点 鼓励适度超前布局城市智能设施

商务部等8部门发布《关于加快“人工智能+消费”发展的实施意见》,围绕服务消费和商品消费两大领域,明确居家、养老、文旅、教育等场景的AI应用方向,推广智能家居、养老机器人等产品,并适度超前布局城市智能设施。

商汤携手香港科技园共建4万P国产算力基建,首阶段预计今年完成
商汤携手香港科技园共建4万P国产算力基建,首阶段预计今年完成

商汤与香港科技园合作共建国产AI算力中心,目标2030年前实现超40000P算力规模,首阶段预计今年完成。该中心配备国产GPU集群,支撑模型训练与推理,服务本地及国际客户。商汤临港AIDC已有4.04万P算力运营经验。

亚马逊正考虑出售人工智能芯片以挑战英伟达
亚马逊正考虑出售人工智能芯片以挑战英伟达

亚马逊正考虑将其开发的TrainiumAI芯片直接出售给其他公司,以挑战英伟达主导地位。该芯片面向需要本地化数据解决方案的国际企业,亚马逊表示不会影响AWS云业务收入,谷歌也有类似计划。

广东:抢抓人工智能发展机遇,建设具有国际竞争力的软件和信息技术服务业创新中心
广东:抢抓人工智能发展机遇,建设具有国际竞争力的软件和信息技术服务业创新中心

广东省印发服务业扩能提质方案,聚焦AI机遇,建设国际竞争力的软件与信息技术创新中心,包括培育核心企业、构建AI服务体系、攻关核心技术、建设开源生态,并部署融资租赁、金融合作、算力网络、6G及智能应用。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。