当前位置:

首页 > 硬件相关 > 加州大学河滨分校等机构揭秘AI如何"读懂"星系照片

加州大学河滨分校等机构揭秘AI如何"读懂"星系照片

Air Explorer Pro
Air Explorer Pro

Air Explorer Pro是一款跨平台多网盘管理工具,可实现一站式完成不同网盘间文件的互传、搜索和同步等操作。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

立即下载
¥99
Windows/macOS 2026-08-17
正版软件 Windows macOS软件 Pro 文件搜索工具 Pro下载 Pro正版软件 Pro购买

星系图像数据激增催生AI辅助分析,分词器选择至关重要。四种分词器中,VQ-VAE重建最差但物理属性预测最优,JetFormer重建最佳但预测较弱,仿射与AIM性能相近且成本最低。分词器决定AI是“理解宇宙”还是“复述图片”,实际应用需依任务目标权衡。

先说一个核心判断:星系图像的爆炸式增长,正让天文学家们陷入一个甜蜜的烦恼。以DESI、欧几里得和LSST为首的新一代巡天项目,每天产出的影像数据量,早已不是人工逐张翻看能够应对的。于是,“基础模型”这类AI技术被请上台面,它们能从海量数据中自动学习规律,帮科学家提炼信息。这本来是好事,但一个往往被忽视的环节——分词器,正在悄悄左右最终效果。

分词器干的事,可以这么理解:你想让一位只懂文字的人分析一幅画,必须先把它“翻译”成文字。翻译的水平——是粗略勾勒轮廓,还是细描每一笔颜色——直接决定了分析结果的深度。分词器就是做这个“翻译”的,把星系图像转换成AI能处理的数字序列。问题在于,不同的翻译方式,会不会让AI对星系的理解——比如距离、质量、恒星形成速度——产生天壤之别?这看似是个技术细节,实则触及了AI天文学的根基:我们究竟是在训练一个“理解宇宙”的AI,还是只是训练了一个“复述图片”的AI?

一、四种“翻译官”的各自性格

为了验证这个想法,研究团队从DESI遗产巡天项目DR8数据集中,精心挑选了64万张星系图像作为实验材料。每张图像都包含g、r、z三个波段的信息,分辨率统一为256×256像素。他们把这些图像灌入同一个名为AstroPT的AI骨架里——这是一个专为天文数据设计的解码器式变换器模型,拥有8900万个参数,共12层,能像GPT那样自回归地“阅读”数据序列。然后,分别给这个骨架配备四种不同的分词器,看看同一个架构在不同翻译方式下会学到什么。

第一种:仿射分词器。最朴素的“直译员”。它把每张图像切成8×8像素的小方块,一共1024块,然后用一个简单的线性数学变换,把每个小方块变成AI能读的数字向量。没有花哨处理,没有额外计算,所有理解工作都交给骨架。优点是简单、快速、成本低,是实验的基准参照。

第二种:AIM分词器。思路相近,也是切方块,但翻译时用了多层感知机——一种能捕捉非线性关系的神经网络。相当于这位翻译员多了一点“理解能力”,能感知到方块内部像素的复杂关系。值得一提的是,仿射和AIM这两种方法都对每个小方块做了z-score标准化,把像素值调整到均值为零、方差为一的标准范围。这有助于训练稳定,但也会让重建出的图像有一种明显的“方格感”。

第三种:JetFormer分词器。灵感来自一篇研究图像自回归生成的论文,采用了一种叫“归一化流”的可逆数学变换。可以把这位翻译员理解为极其严谨——翻译完全可逆,拿到译稿就能完整还原原文,一个字都不丢。图像先经过均匀去量化处理,再通过一个二维流模块变成潜在表示。由于整个过程可逆,编码器和解码器是同一个模块,不需要单独预训练,而是从头到尾与AI骨架一起训练。JetFormer用混合高斯分布来预测每个连续值的概率,而非像离散分词器那样从一个固定词汇表里选词。值得一提的是,它训练时需要一个特殊的“噪声课程表”——RGB噪声从σ=64逐渐降为零,潜在空间噪声也从0.3降至零。没有这个课程表,流模型可能会把信息偷偷藏在人类感知不到的高频维度里,导致训练崩溃。

第四种:VQ-VAE分词器。可以把它比作一位习惯用“图章盖戳”来分类的翻译员。它先用一个编码器网络把图像压缩成连续的潜在向量,然后强制把每个向量“量化”到一个由512个固定代码组成的词典中的最近邻。换句话说,这位翻译员只认512个固定词汇,无论原始图像多复杂,最终都要归到某个词汇上。VQ-VAE在正式训练AstroPT骨架之前,已经单独在星系图像上预训练并冻结了词典。训练时用交叉熵损失来预测下一个离散词元。这种“预先学好词典再冻结”的设计,让它与其他三种分词器在训练流程上存在本质差异——这一点,研究团队也坦诚地承认了:这四种比较并非完全等价的对照实验,而是各自按照文献最佳实践来做的“最公平的竞争”。

二、谁的重建效果最好?答案出人意料地简单

判断一个翻译官好不好,最直接的标准是:拿到译稿后,能还原出多像原文的内容?研究团队用两个指标量化:SSIM(结构相似性,越接近1越好)和PSNR(峰值信噪比,越高越清晰)。

JetFormer在图像重建上以绝对优势胜出。在5000张随机测试图像上,它的平均PSNR达到31.11分贝,SSIM均值为0.762。这意味着它还原出的星系图像,保留了旋臂的细节、星系核心的亮度结构,以及弥散的低表面亮度背景光——这些细节对天文学家研究星系结构至关重要。

相比之下,VQ-VAE的重建质量就差了不少:PSNR均值只有23.57分贝,SSIM仅为0.544。虽然大致轮廓还在,但仔细观察会发现,明亮核心周围出现了模糊的“云雾状”伪影,甚至出现了原图中并不存在的细小红色结构,低表面亮度的弥散外围也大量丢失。这并不难理解:只有512个词汇的词典,显然无法精确描述真实宇宙图像中千变万化的细节。

仿射和AIM两种方法因为对每个图像方块做了z-score标准化,重建出的图像会有肉眼可见的“方格感”——整张图像被分成一个个8×8的小格,每个小格内部亮度被独立标准化,导致相邻方块之间出现明显边界。这并非质量低劣,而是标准化处理的必然代价。

三、谁最懂星系的“身份证”?数字背后的物理意义

重建清晰固然重要,但对天文学家来说,更关键的问题是:AI学到的“知识”有多少物理意义?换句话说,通过AI提取的数字特征,能不能准确推断出星系真实的物理属性?

研究团队从每个AstroPT模型的中间层提取特征向量,然后分别训练线性探针和MLP探针来回归13个物理属性。这13个属性覆盖了天文学中最常见的星系描述维度:光度量、颜色指数、光度红移和光谱红移、比恒星形成率、恒星质量,以及五个形态指标。评估指标是决定系数R²,数值从0到1,越接近1预测越准确。测试集包含16.7万个星系,用10折交叉验证保证结果可靠。

结果揭示出一幅引人深思的图景。VQ-VAE在几乎所有属性的线性和MLP探针上都名列前茅。以g-r颜色为例,VQ-VAE的线性探针R²达到了82,而仿射和AIM只有71,JetFormer为74。对于光谱红移这个天文学中极为重要的距离指标,VQ-VAE线性探针达到85,仿射和AIM为77,JetFormer为80。更耐人寻味的是,VQ-VAE的线性探针分数在大多数属性上甚至超过了MLP探针——这意味着512个词汇的硬量化不只是在压缩信息,而是在重新组织信息的方式,让物理属性以一种极为“整齐”的方式排列在特征空间中,以至于一个简单的直线就能把它们找出来。

JetFormer在颜色、红移、恒星质量和恒星形成率等“光谱相关”属性上稳定超越仿射和AIM,但在形态指标上却输给了AIM。仿射和AIM在几乎所有属性上得分相差无几——这个发现颇具意味:耗费更多计算资源的MLP头并没有比简单的线性变换为AI带来实质性的知识增益,骨架本身的表达能力已经足够强大,翻译环节的复杂度对最终结果影响有限。

关于g-r颜色比r-z颜色更容易预测这一现象,研究团队给出了物理解释:g-r颜色在样本所覆盖的红移范围内动态变化范围更大,且与年轻恒星的辐射紧密相关,因此作为回归目标更“容易区分”。r-z颜色更多反映老年恒星星族,与恒星总质量相关,属性更稳定,但也因此区分度较低。g-r对尘埃遮蔽更敏感,这解释了为什么sSFR比M*更难预测,也解释了为什么MLP探针在sSFR上比线性探针改进幅度更大——尘埃、年龄与颜色之间的非线性纠缠,需要更强的模型才能解开。

研究团队还做了一个“分组探针”实验,把13个属性归为几个大类,分别考察每种分词器把多少“注意力”分配给了哪类属性。JetFormer把更多的特征空间用于直接可见的图像属性——表观光度和结构参数的分组探针R²分别达到0.33和0.29,而VQ-VAE只有0.19和0.16。相反,VQ-VAE把更多空间留给了需要“抽象推理”的高层属性,比如红移和绝对光度。这说明VQ-VAE的词典机制在某种程度上引导AI骨架跳过了像素层面的直觉,直接去学习更深层的物理规律。

四、两个极端之间的“信息悖论”

到这里,一个矛盾浮出水面:JetFormer重建最好,却在物理属性预测上相对弱势;VQ-VAE重建最差,却在物理属性预测上最强。这个反差并非偶然,研究团队通过一个巧妙的实验揭示了背后的机制。

他们从18万张测试和验证星系图像出发,分别提取JetFormer重建图像、VQ-VAE重建图像,以及原始图像的ResNet-50特征——这是一个在ImageNet上预训练的通用视觉网络——然后用相同的线性和MLP探针来预测物理属性。这相当于绕过了分词器生成的内部特征,直接问:从重建出来的像素里,还能找回多少原始物理信息?

JetFormer重建图像的探针分数几乎和原始图像持平——每个光度属性的误差都在波动范围内,形态属性最多差4个R²点。这证明JetFormer的可逆流确实把原始图像里的全部信息都“带过来了”,只是这些信息以一种线性探针难以直接提取的方式散布在潜在空间里。VQ-VAE重建图像的探针分数则系统性地低于原始图像,在形态、sSFR和绝对光度上的损失尤为明显,而颜色指数的损失相对较小。这证明VQ-VAE的词典量化是一个不可逆的操作——它把细节真正丢掉了,不是藏起来了,是消失了。

换句话说,JetFormer是一个完美的“保险箱”:所有信息都在,但钥匙很难找。VQ-VAE则是一个严格的“筛选器”:它主动丢弃了大量细节,但正是这种丢弃让剩下的信息按照物理意义重新排列,变得更容易提取。

五、四份“星系档案”长什么样?

研究团队还通过PCA主成分分析和UMAP流形学习两种降维可视化方法,检验了四种分词器生成的特征空间结构,相当于给特征空间画了一张“地图”,用不同颜色标注了每个星系的物理属性。

在PCA投影下,仿射和AIM的特征空间呈现出开放的马蹄形弧线,整体沿着一个主方向展开,类似单一维度的渐变色带;JetFormer形成更拉伸的月牙形;VQ-VAE则形成一个密集的填充椭圆。在UMAP投影下,仿射和AIM破碎成大量分散的小岛,而JetFormer和VQ-VAE保持了单一连通的流形结构。值得注意的是,无论是哪种投影方式、哪种分词器,物理属性的渐变梯度都清晰可见——g-r颜色和光度红移之间的相关性在所有方法中都表现出连贯的颜色过渡,这一现象反映了星系光谱随距离变化而导致颜色系统性偏移的真实物理规律。特征空间还沿着另一个方向编码了形态和光度信息:平滑的早型星系倾向于占据较亮的区域,与旋涡星系分居两侧——这与天文学中著名的星系形态-星等关系完全吻合,完全来自图像本身而无需任何人工标注。

仿射和AIM的特征空间在两种投影下都高度相似,再次印证了在强大的AstroPT骨架面前,额外的MLP翻译层并未带来本质不同的特征组织方式。

六、成本账单:时间与能源的天平

研究团队也诚实地记录了四种方案的训练成本。仿射和AIM各用一块NVIDIA H100显卡训练了3小时,能耗约2.1千瓦时。JetFormer需要两块H100并行训练8小时,能耗约11.2千瓦时,是前者的五倍以上。VQ-VAE则在一块NVIDIA Quadro GV100上训练了20小时,能耗约5.2千瓦时。用能耗来比较更公平:仿射和AIM最省钱,JetFormer最贵,VQ-VAE居中。研究团队计划在论文去匿名化后公开所有预训练代码和模型权重,以避免他人重复训练带来的额外碳排放。

研究的边界与未来的路

研究团队对自己工作的局限性保持了坦诚。首先,探针方法只能检测“能被线性或非线性函数直接提取的信息”,不能排除某些信息确实存在但探针功能不够强大的可能性。其次,VQ-VAE的预训练流程与其他方法不同,其在物理属性预测上的优势可能部分归因于预训练编码器的质量,而非仅仅是量化机制本身的功劳。第三,这项研究没有探索数据集规模或模型参数量变化时各分词器性能的变化趋势,也没有测试跨仪器或跨波段数据的泛化能力。

这些局限也指向了未来的研究方向:构建一个更系统的“分词器基准”,基于可验证的天文物理真值来评估各种图像分词策略,不仅面向星系图像,也面向光谱、时序、多模态等更广泛的天文数据形式。

归根结底,这项研究想说的是:在训练天文AI的时候,我们不能只看模型能不能把图像画得漂亮,更要看它是不是真的“理解”了图像背后的物理。这两件事不是一回事,而分词器的选择,正是决定AI走向哪个方向的第一道关口。对于计划构建多模态天文基础模型的研究者而言,一个关键的实际建议浮现出来:如果目标是光度测量和光谱推断,VQ-VAE的压缩表示可能更有用;如果目标是图像重建或生成,JetFormer是更可靠的选择;如果计算资源有限且任务偏向形态分析,仿射分词器以最低的成本提供了与AIM相当的性能。没有一个分词器能在所有任务上都胜出——这本身就是一个值得所有AI工程师记住的结论。

Q&A

Q1:VQ-VAE分词器为什么预测星系物理属性比JetFormer更准确,但重建图像质量却更差?

A:VQ-VAE通过一个只有512个固定代码的词典来压缩图像,这种硬量化会丢弃大量像素细节,导致重建出的图像出现模糊和伪影。但正是这种“强迫归类”的机制让剩下的信息按照物理意义重新排列,使恒星质量、红移等属性在特征空间中变得高度可区分,因此预测准确率反而更高。JetFormer通过可逆变换保留了所有原始像素信息,重建质量最高,但这些信息在潜在空间中散布得较为杂乱,探针很难从中直接提取单个物理属性。

Q2:仿射分词器和AIM分词器预测效果几乎一样,那AIM分词器的MLP有什么意义?

A:从这项实验结果来看,在AstroPT这个足够强大的骨架下,AIM分词器额外引入的多层感知机(MLP)几乎没有带来实质性的性能提升。两者在所有13个物理属性上的探针分数高度接近,PCA和UMAP可视化的特征空间结构也极为相似。这表明当后端变换器模型足够表达能力强时,翻译环节是线性还是非线性,对最终学到的知识影响非常有限。

Q3:天文基础模型选择分词器时应该怎么权衡?

A:根据这项研究的结论,分词器的选择应当基于具体的下游任务目标。如果模型主要用于光度测量、红移估算或光谱属性推断,VQ-VAE的离散压缩表示能提供更线性可访问的物理信息。如果模型的目标包括图像重建、视觉生成或需要保留低表面亮度细节的科学分析,JetFormer的可逆流是更合适的选择。对于计算资源有限且侧重形态分析的场景,仿射分词器以最低成本提供了与AIM相当的性能。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系bd@zhengruan.com
作者最新文章
硬件相关 AI
相关文章 更多
显示器色温怎么调不刺眼?色温调多少看着最舒服
显示器色温怎么调不刺眼?色温调多少看着最舒服

详解显示器色温的舒适调节区间、刺眼的核心诱因,以及在不同使用场景与环境光下的具体调节步骤与校准方法。

显卡风扇不转怎么回事判断是否正常及解决方法
显卡风扇不转怎么回事判断是否正常及解决方法

发现显卡风扇不转先别慌,这很可能是正常的智能启停功能。本文详解如何区分待机静音与硬件故障,提供从软件检测到物理清理的完整解决思路。

笔记本加内存条后无法开机怎么办及解决方法
笔记本加内存条后无法开机怎么办及解决方法

笔记本加装新内存后遇到黑屏或无法开机?不要慌张,本文通过重新插拔、清洁金手指、单根测试等具体操作步骤,帮你快速判断是安装失误还是硬件不兼容,并给出相应解决办法。

电脑主机前置usb不能用怎么解决排查修复教程
电脑主机前置usb不能用怎么解决排查修复教程

针对电脑主机前置USB接口无法识别设备的问题,本文提供一套基于因果逻辑的排查流程。涵盖检查机箱内部USB针脚连接、验证BIOS中USB控制器状态、更新芯片组驱动以及排除供电不足等常见原因,帮助用户快速恢复接口功能。

无线鼠标充不进电解决办法及故障排查步骤
无线鼠标充不进电解决办法及故障排查步骤

遇到无线鼠标充不进电的问题,不要急于更换设备。本文详解从清理接口氧化层、更换数据线到检测电池电压的完整排查流程,帮助你判断是临时故障还是硬件损坏。

蓝牙游戏手柄连接教程吃鸡
蓝牙游戏手柄连接教程吃鸡

想知道如何用蓝牙手柄玩吃鸡游戏?本文详细讲解手机蓝牙手柄的连接步骤、主流映射软件的使用方法以及实战中的键位布局技巧,助你提升射击手感,同时解析外设玩家的匹配机制与注意事项。

游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法
游戏手柄蓝牙连接为何每次都要重连原因排查与解决方法

本文深入分析游戏手柄蓝牙频繁断开且需重连的根本原因,涵盖电池电压检测、操作系统电源管理策略及驱动冲突。通过具体的系统设置调整和固件更新步骤,解决蓝牙握手失败问题,恢复手柄的稳定连接状态。

显示器画面模糊抖动怎么解决及排查方法教程
显示器画面模糊抖动怎么解决及排查方法教程

遇到显示器画面模糊或抖动时,可通过检查视频连接线、调整系统分辨率与刷新率、更新显卡驱动等步骤进行排查和修复。

小米智能门锁换电池后怎么开机
小米智能门锁换电池后怎么开机

小米智能门锁更换新电池后无法开机或屏幕不亮?本文详解电池极性检查、金属触点清洁及强制重启方法,帮你快速解决供电问题,让门锁恢复正常使用。

电视机声音怎么连接到外置音响
电视机声音怎么连接到外置音响

想让电视声音更震撼?本文详解如何通过HDMI ARC、光纤、蓝牙和3.5mm接口将电视连接至外置音响,包含具体设置步骤与常见问题排查,助你轻松打造家庭影院。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

PDF教程
PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
Shapr3D macOS版
Shapr3D macOS版
Mac

Shapr3D是一款面向工业设计、机械工程、建筑概念和三维打印工作流的CAD软件。Mac版采用Parasolid建模内核,支持草图约束、实体建模、工程图、可视化渲染及常见CAD格式交换,并可通过账户在多台设备之间同步项目。

REAPER macOS版
REAPER macOS版
Mac

REAPER是Cockos开发的数字音频工作站,提供多轨音频与MIDI录制、剪辑、处理、混音和母带制作工具。Mac版兼容Intel与Apple芯片,支持AU、VST、VST3、CLAP等插件格式,并提供高度可定制的工作流程。

Ableton Live macOS版
Ableton Live macOS版
Mac

Ableton Live 是面向音乐制作人与现场表演者的数字音频工作站,提供编曲视图、独具特色的现场视图、音频录制、MIDI创作、实时变速、乐器及效果器。Mac版原生支持Apple芯片,并可连接音频接口、MIDI控制器和第三方插件。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。

即将离开本站
您即将前往第三方网站,请确认是否继续?