当前位置:

首页 > 硬件相关 > 当AI画师学会"记住承诺":中国科大打造复杂图像生成新框架SCOPE

当AI画师学会"记住承诺":中国科大打造复杂图像生成新框架SCOPE

中国科学技术大学等机构提出SCOPE框架,解决AI生成复杂图像时遗漏细节的问题。该框架将用户需求分解为结构化语义承诺,通过分解、综合、生成、验证四步流水线协同工作,并调用检索、推理、修复三种技能精准处理问题。在评测基准Gen-Arena上,SCOPE表现显著优于主流模型,提升了复杂图像生成的承诺兑现率。


一项由中科大(MoE脑启发智能感知与认知重点实验室)联合香港理工大学、南洋理工大学共同完成的研究,于2026年5月以预印本形式发布。这项研究直指当前AI图像生成领域一个令人头疼的顽疾:当你的描述足够复杂时,AI画师总会“忘记”一些关键细节。

当AI画师忘记了自己答应画什么

想象一下,你雇了一位画师,提出了一个相当具体的要求:“帮我画一幅画:左边站一个机器人小偷,右边站一个小孩侦探,中间的玻璃展柜里放着一架宇宙飞船模型,背景墙上挂着一幅宇宙星云壁画,还有一个穿银色夹克的馆长举着一张金唱片。”

要求够复杂了吧?问题来了:画师一边构思一边动笔,画着画着,他忘记了机器人小偷要站在左边,忘记了金唱片要举在手里,甚至把宇宙飞船画成了火箭发射台。最终你拿到的作品,单看每个部分或许都不错,但与你最初的设想相比,简直是南辕北辙。

这正是当今主流AI图像生成系统面临的核心困境。你给它一段复杂的文本描述,它确实能生成一张看起来赏心悦目的图片,但那些被你明确要求的细节——谁在哪个位置、谁拿着什么、背景里该有什么——往往要么被遗漏,要么被画错,要么干脆被AI“创意发挥”掉了。

上述研究团队将这个问题研究透了,并提出了一套名为SCOPE的系统,专门来解决这个“AI画师记性差”的问题。下面,我们就顺着这支团队搭建的“生产流水线”,看看他们是如何让AI真正兑现每一个“视觉承诺”的。

一、被遗忘的“承诺”:问题究竟出在哪里

把复杂图像生成比作一个大型施工项目,或许更容易理解问题的根源。业主(用户)交给施工方(AI)一份详细的设计图纸,标明了每个房间的家具、墙壁颜色和门窗尺寸。然而,施工方动工后,每道工序的工人拿到的却是不同版本的图纸,甚至有些工人根本没图纸,全靠口口相传。结果可想而知:客厅的沙发颜色被改了,卧室的窗户尺寸搞错了。验收时业主发现,房子是盖起来了,但与最初的设计相去甚远。

研究团队将这种现象命名为“概念裂缝”。说得更直白些:在一次完整的图像生成过程中,用户最初提出的那些具体要求——哪些角色要出现、它们长什么样、彼此关系如何、各自在画面什么位置——这些要求在生成流程的不同阶段,并没有被当作统一的、可追踪的单元来对待。

前期检索到的信息没有被妥善记录,中期生成的图像与原始要求之间的偏差无人核对,后期发现问题想修改,却又不清楚问题究竟出在哪一个具体的要求上。每个环节似乎都做了点工作,但这些努力彼此割裂,就像施工现场各司其职却互不沟通的工人。

研究团队把这些“用户提出的、图像最终必须满足的具体要求”统称为语义承诺。这个词非常形象:承诺就是答应要做到的事,语义承诺就是那些被明确要求、必须在图像里兑现的视觉细节。问题的关键不在于AI不知道这些承诺的存在,而在于它在生成过程中,无法始终将这些承诺作为可识别、可追踪、可核对的独立单元来操作。

正因如此,即便AI系统在某个步骤查到了某个角色的外观,或在另一个步骤发现了图像中的错误,这些信息也未必能精准地作用到“修复那个具体被画错的承诺”上——因为缺少一份贯穿始终的“承诺档案”将它们串联起来。

二、SCOPE:给每个承诺建一份活的档案

SCOPE的核心思路,可以用高效的项目管理来类比。一个靠谱的项目经理会为每项工程要求建立清单,记录其当前状态——是已落实、待确认,还是需返工。所有工人都参照同一份清单作业,每完成或修改一个条目就更新状态。最终验收也对照清单逐条核查,而非凭感觉说“整体还不错”。

SCOPE就是为AI图像生成流程配备的这样一位“项目经理”。它把用户的复杂需求分解成一份结构化的语义规范,用一个三元组表示:目标实体(E)、可验证承诺(C)、未解决信息(U)。

目标实体就是图像里必须出现的“演员名单”,比如机器人小偷、小孩侦探、馆长等。可验证承诺是对这些实体提出的具体要求,进一步分为三类:属性约束(实体长什么样、数量多少)、关系约束(实体间的交互)以及布局约束(实体在画面中的位置)。未解决信息则记录那些“还没弄清楚”的疑问,比如用户提到了一个真实IP角色,但AI不确定其具体外观,就在这里标记“需要查询”。

关键在于,这份规范不是一次性生成后就固定不变的,而是一份活的档案。随着生成流程推进,它会不断被更新:查到了角色外观,就更新对应条目;发现某个实体位置画错了,就标记“已失败,待修复”;修复后,再更新状态。整个流程从头到尾共享同一份档案,任何环节的操作结果都写回其中,后续环节便能准确知晓每个承诺的当前状态。

这份活的档案,解决的正是“概念裂缝”的根本问题:它把原本可能在不同步骤里各自为战的操作,全部锚定在同一个可识别的语义单元上。

三、四步流水线:从描述到图像的完整工作链

有了这份活的档案,SCOPE还搭建了一条由四个“岗位”依次协作的核心流水线。

第一个岗位是分解器,负责将用户提交的文字描述转化为那份结构化的语义规范。它的工作是梳理出用户描述中所有显性和隐性的要求,并填入档案。

第二个岗位是综合器,任务是根据当前档案的状态,将其中已确定的信息整合成一段连贯、详细的描述,以便直接交给图像生成引擎使用。这好比将确认无误的施工图纸,汇总成清晰的施工任务书。

第三个岗位是生成器,负责真正生成或编辑图像。它接收任务书,产出图像。

第四个岗位是验证器,充当流水线中的“质检员”。它拿到生成的图像后,并非笼统评价,而是逐条核对档案中的每个实体和约束,给出“通过”、“失败”或“不确定”的判断,并附上原因。

这四个岗位形成一个闭环:如果验证全部通过,任务完成;如果有条目失败,流程则进入下一轮迭代,调动相应技能修复问题,再次经历综合、生成、验证的循环。整个流程最多运行三轮。

四、三种关键技能:查资料、推理、修图

仅有流水线还不够,因为有些问题流水线本身无法解决。为此,研究团队为SCOPE设计了三种可根据情况灵活调用的条件技能。重要的是,这些技能的调用都严格锚定在档案里具体的待解决或已失败条目上,绝非无的放矢。

第一种是检索技能,对应“缺信息”的情况。当档案记录显示某个承诺依赖的外部证据尚未找到时(例如需要查询真实游戏角色的确切外观),检索技能便被激活,通过搜索引擎等工具获取资料,并将结果写回档案。

第二种是推理技能,对应“信息不明确”的情况。有时用户的描述隐含了某些要求,无需查外部资料,但需通过逻辑推断才能确定具体内容。推理技能负责厘清这类模糊或隐性的承诺。

第三种是修复技能,对应“已生成但验证失败”的情况。当验证器发现某个已被明确规定的承诺未在图像中满足时,修复技能登场。它并非简单地重新生成整张图,而是根据失败的具体性质,选择三种策略中最合适的一种:若任务书描述不准确,则重写任务书;若仅是图像局部瑕疵,则进行局部编辑;若问题范围太广或太根本,则整体重新生成。这种“哪里出问题修哪里”的精准策略,效率远高于无差别重做。

这三种技能的设计逻辑体现了SCOPE的核心哲学:每一次技能调用都有明确缘由,都对应档案中的一个具体问题条目,调用结果也会写回档案,供后续环节利用。技能不是随手可用的工具,而是被精确派遣处理特定承诺问题的专家。

五、Gen-Arena:怎么才算“真正兑现了承诺”

有了SCOPE系统,下一个问题便是:如何评价它的表现?研究团队发现,现有的AI图像生成评测标准存在一个根本缺陷——它们太“宽容”了。要么给图像整体打一个匹配度分数,要么给一堆独立检查项分别打分,却忽略了这些检查项之间的逻辑依存关系。

这好比在餐厅点菜,服务员端上的菜里有三道是你点的、两道不是你点的,厨师却以“总体满足度还不错”为由辩解。然而,缺席的那两道菜可能恰恰是宴席的主菜,没有它们,其他配菜再精彩也失去了意义。

为了建立一个能真实反映“承诺是否被兑现”的严格评测标准,研究团队构建了一个全新的人工标注基准测试集,命名为Gen-Arena

Gen-Arena包含300个测试实例,覆盖卡通、游戏、体育、娱乐、竞技和典礼六个类别。每个实例配有一段自然语言提示词,并由人工标注者精心整理出配套的结构化评测规范,明确列出图像中必须出现的所有目标实体及针对它们的原子约束。整个数据集共包含1954个实体和2533条约束,并为310个需要精确匹配真实IP角色外观的实例提供了参考图片。

评测方法称为实体门控意图通过率。其逻辑非常直观:首先检查图像中所有必须出现的实体是否都已正确呈现;只有当所有实体都通过检查,才进一步核查那些依赖于这些实体的具体约束是否被满足;最终,只有全部实体和全部约束都通过,该实例才算整体通过。任何一个实体缺席或画错,整个实例直接判为失败,不考虑其他部分做得多好。

这种“一票否决”的严格标准,正是为了对抗那种“整体上还凑合”的虚假成功感。研究团队认为,如果你要求画的是《侠盗猎车手》里的特定角色,而这个角色没出现或被替换,那么无论背景多美、构图多精彩,这张图都是失败的。

六、实验结果:数字说明了什么

SCOPE在Gen-Arena上的表现,让这个领域的其他竞争者相形见绌。在这场严格的承诺兑现测试中,绝大多数直接生成型AI的得分接近于零。

具体来看:Janus-Pro-7B、SDXL、PixArt-Sigma的整体得分均为0.00,意味着在300个严格要求下,它们几乎从未完整兑现所有承诺;FLUX.1-dev得分为0.01,SD-3.5-large为0.00,Qwen-Image为0.02,Z-Image-Turbo为0.01。即便是表现最好的直接生成模型Nano Banana Pro,得分也只有0.21。换句话说,在每五个复杂图像生成任务中,它大约只有一个能完整兑现所有承诺。

相比之下,SCOPE的整体得分达到了0.60,是Nano Banana Pro的近三倍,比第二名高出39个百分点。在六个类别中,体育和典礼两个类别的表现尤为突出,分别达到0.72和0.74。这两个类别的任务通常涉及真实的人物身份识别、特定的赛事关系以及精确的场景构图,而这正是SCOPE通过检索和推理技能最能发挥优势的场景。

更细粒度的诊断数据揭示了更深层的问题。在实体单项通过率上,Qwen-Image和Z-Image-Turbo其实不差,分别达到0.83和0.84,意味着它们大多数实体单独来看是画出来了的。但它们的整体得分却接近于零,这说明问题在于“单独看每个实体还行,但要所有实体和所有约束同时全部通过,就几乎不可能了”。这印证了“严格承诺兑现”这一目标的难度:单个元素的准确率高,并不等于整体满足度高。SCOPE将实体通过率提升到0.92,约束通过率提升到0.83,两者共同作用,才带来了0.60的整体高分。

在外部基准测试上,SCOPE同样表现出色。在测试世界知识密集型图像生成能力的WISE-V基准上,SCOPE获得了0.907的综合分,六个子类别中五个排名第一,整体比Nano Banana Pro高出3.5%;在测试知识与推理密集型视觉生成的MindBench上,SCOPE获得0.61的综合分,比Nano Banana Pro高出近49%。这些结果表明,SCOPE的承诺追踪机制并非只对特定评测有效,而是具有更广泛的通用价值。

七、消融实验:把每块积木抽掉,看哪个最关键

为了弄清SCOPE各个组件的贡献,研究团队进行了一系列消融实验,相当于把整套系统拆开,逐一关闭某些功能,观察效果变化。

将SCOPE简化为最原始的单次直接生成,得分为0.21。如果给它三次独立生成的机会并挑选最好的一次,得分提升到0.40——这说明多次尝试有价值,但提升幅度有限。用一种称为“自我改进”的方式替换SCOPE(同样有三次生成机会,但没有结构化的承诺档案,仅用自由形式的批评来重写描述),得分为0.39,甚至比“挑最好一次”的策略还低。这表明,没有结构化承诺档案作为支撑,即便有迭代修改的机会,也难以将局部改进累积为整体成功。

在SCOPE内部,若关闭检索和推理技能(仅保留分解和修复),得分暴跌至0.22,几乎与单次直接生成一样差。这有力地说明:光有结构化分解,而没有技能来填充那些“未解决信息”,承诺档案充其量是一份空白的待办清单,无法帮助生成更好的图像。若单独关闭修复技能(保留检索和推理),得分为0.42——比没有检索推理时高出一大截,但比完整SCOPE的0.60低了18个百分点。这说明检索和推理技能负责在生成前解决“我不知道该画什么”的问题,而修复技能负责解决“生成后发现画错了”的问题,两者缺一不可,相辅相成。

八、系统的边界:诚实面对不足

研究团队并未只谈成绩,他们也坦率指出了SCOPE目前存在的两个主要局限。

第一个局限是效率成本。SCOPE需要在每次生成任务中调用多次大型语言模型、图像生成引擎、验证器,并可能调用搜索引擎,最多运行三轮迭代。与直接输入描述、一次出图的方式相比,SCOPE的时间成本和计算开销要高得多。这在追求实时响应的应用场景中是一个实际障碍。研究团队提出,未来可以通过更智能的“早停”策略或更有选择性的技能调用来降低开销,但这仍是留给未来工作的课题。

第二个局限是验证器的可靠性。整个SCOPE系统的修复逻辑高度依赖验证器的判断:验证器说某个实体或约束失败了,系统才会去修复它;验证器说通过了,系统就认为没问题。但验证器本身并非完美——它可能将正确的元素误判为失败(假阴性),触发不必要的修复;也可能将画错的元素误判为通过(假阳性),导致真正的问题被忽略。验证器的精准度直接决定了整套修复机制的有效性,这是一个亟需进一步改进的薄弱环节。

归根结底,SCOPE的成就可以用一句话概括:它让AI在生成复杂图像时,不再仅仅是“努力把话听进去”,而是真正做到了“从头到尾记住并核对每一个承诺”。通过建立一份活的承诺档案、设计精准匹配问题类型的三种技能、搭配严格的逐项验证机制,SCOPE为那些原本会因复杂度而“跑偏”的图像生成任务,提供了一条更可靠的完成路径。

得分从0.21跃升至0.60,背后并非魔法,而是一套系统性地减少“信息在传递过程中丢失或漂移”的工程方案。当然,更高的准确率代价是更高的计算成本,而验证器自身的局限也提醒我们,这条路仍有很长的距离要走。但方向是清晰的:对于那些真正需要“所有细节都对”才算成功的复杂图像生成需求,单纯依赖生成模型的“理解力”和“运气”已经不够了,需要更明确的流程管理和承诺追踪机制介入其中。

Q&A

Q1:SCOPE和普通的AI图像生成有什么本质区别?

A:普通AI图像生成是“一次性把话翻译成图”,缺乏系统性的机制来追踪用户要求是否被满足。SCOPE的核心区别在于引入了一份“活的承诺档案”,将用户的所有具体要求分解为可追踪的条目,并在整个生成流程(包括查资料、生成、核查、修复)的每个环节都参照这份档案进行操作,确保每个条目的状态始终可识别、可管理。

Q2:EGIP评测标准为什么对所有基线模型得分都极低?

A:EGIP采用“全部通过才算通过”的严格逻辑。一张图像中,只要有任何一个必须出现的实体缺席或画错,整个实例就直接判为失败,无论其他部分做得多好。这个标准揭示了一个现实:大多数模型生成单个元素的能力尚可,但在同一张图像中同时满足所有实体和所有约束,成功率极低。

Q3:Gen-Arena基准测试集覆盖了哪些类型的图像生成任务?

A:Gen-Arena包含300个人工标注的实例,涵盖六个类别:卡通、游戏、体育、娱乐、竞技和典礼。每个实例都配有自然语言提示词和结构化的评测规范。整个数据集共包含1954个实体和2533条约束,其中310个实例还附有参考图片,专门用于那些需要精确匹配真实IP角色外观的任务。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。