当AI画师学会"记住承诺":中国科大打造复杂图像生成新框架SCOPE
中国科学技术大学等机构提出SCOPE框架,解决AI生成复杂图像时遗漏细节的问题。该框架将用户需求分解为结构化语义承诺,通过分解、综合、生成、验证四步流水线协同工作,并调用检索、推理、修复三种技能精准处理问题。在评测基准Gen-Arena上,SCOPE表现显著优于主流模型,提升了复杂图像生成的承诺兑现率。

一项由中科大(MoE脑启发智能感知与认知重点实验室)联合香港理工大学、南洋理工大学共同完成的研究,于2026年5月以预印本形式发布。这项研究直指当前AI图像生成领域一个令人头疼的顽疾:当你的描述足够复杂时,AI画师总会“忘记”一些关键细节。
当AI画师忘记了自己答应画什么
想象一下,你雇了一位画师,提出了一个相当具体的要求:“帮我画一幅画:左边站一个机器人小偷,右边站一个小孩侦探,中间的玻璃展柜里放着一架宇宙飞船模型,背景墙上挂着一幅宇宙星云壁画,还有一个穿银色夹克的馆长举着一张金唱片。”
要求够复杂了吧?问题来了:画师一边构思一边动笔,画着画着,他忘记了机器人小偷要站在左边,忘记了金唱片要举在手里,甚至把宇宙飞船画成了火箭发射台。最终你拿到的作品,单看每个部分或许都不错,但与你最初的设想相比,简直是南辕北辙。
这正是当今主流AI图像生成系统面临的核心困境。你给它一段复杂的文本描述,它确实能生成一张看起来赏心悦目的图片,但那些被你明确要求的细节——谁在哪个位置、谁拿着什么、背景里该有什么——往往要么被遗漏,要么被画错,要么干脆被AI“创意发挥”掉了。
上述研究团队将这个问题研究透了,并提出了一套名为SCOPE的系统,专门来解决这个“AI画师记性差”的问题。下面,我们就顺着这支团队搭建的“生产流水线”,看看他们是如何让AI真正兑现每一个“视觉承诺”的。
一、被遗忘的“承诺”:问题究竟出在哪里
把复杂图像生成比作一个大型施工项目,或许更容易理解问题的根源。业主(用户)交给施工方(AI)一份详细的设计图纸,标明了每个房间的家具、墙壁颜色和门窗尺寸。然而,施工方动工后,每道工序的工人拿到的却是不同版本的图纸,甚至有些工人根本没图纸,全靠口口相传。结果可想而知:客厅的沙发颜色被改了,卧室的窗户尺寸搞错了。验收时业主发现,房子是盖起来了,但与最初的设计相去甚远。
研究团队将这种现象命名为“概念裂缝”。说得更直白些:在一次完整的图像生成过程中,用户最初提出的那些具体要求——哪些角色要出现、它们长什么样、彼此关系如何、各自在画面什么位置——这些要求在生成流程的不同阶段,并没有被当作统一的、可追踪的单元来对待。
前期检索到的信息没有被妥善记录,中期生成的图像与原始要求之间的偏差无人核对,后期发现问题想修改,却又不清楚问题究竟出在哪一个具体的要求上。每个环节似乎都做了点工作,但这些努力彼此割裂,就像施工现场各司其职却互不沟通的工人。
研究团队把这些“用户提出的、图像最终必须满足的具体要求”统称为语义承诺。这个词非常形象:承诺就是答应要做到的事,语义承诺就是那些被明确要求、必须在图像里兑现的视觉细节。问题的关键不在于AI不知道这些承诺的存在,而在于它在生成过程中,无法始终将这些承诺作为可识别、可追踪、可核对的独立单元来操作。
正因如此,即便AI系统在某个步骤查到了某个角色的外观,或在另一个步骤发现了图像中的错误,这些信息也未必能精准地作用到“修复那个具体被画错的承诺”上——因为缺少一份贯穿始终的“承诺档案”将它们串联起来。
二、SCOPE:给每个承诺建一份活的档案
SCOPE的核心思路,可以用高效的项目管理来类比。一个靠谱的项目经理会为每项工程要求建立清单,记录其当前状态——是已落实、待确认,还是需返工。所有工人都参照同一份清单作业,每完成或修改一个条目就更新状态。最终验收也对照清单逐条核查,而非凭感觉说“整体还不错”。
SCOPE就是为AI图像生成流程配备的这样一位“项目经理”。它把用户的复杂需求分解成一份结构化的语义规范,用一个三元组表示:目标实体(E)、可验证承诺(C)、未解决信息(U)。
目标实体就是图像里必须出现的“演员名单”,比如机器人小偷、小孩侦探、馆长等。可验证承诺是对这些实体提出的具体要求,进一步分为三类:属性约束(实体长什么样、数量多少)、关系约束(实体间的交互)以及布局约束(实体在画面中的位置)。未解决信息则记录那些“还没弄清楚”的疑问,比如用户提到了一个真实IP角色,但AI不确定其具体外观,就在这里标记“需要查询”。
关键在于,这份规范不是一次性生成后就固定不变的,而是一份活的档案。随着生成流程推进,它会不断被更新:查到了角色外观,就更新对应条目;发现某个实体位置画错了,就标记“已失败,待修复”;修复后,再更新状态。整个流程从头到尾共享同一份档案,任何环节的操作结果都写回其中,后续环节便能准确知晓每个承诺的当前状态。
这份活的档案,解决的正是“概念裂缝”的根本问题:它把原本可能在不同步骤里各自为战的操作,全部锚定在同一个可识别的语义单元上。
三、四步流水线:从描述到图像的完整工作链
有了这份活的档案,SCOPE还搭建了一条由四个“岗位”依次协作的核心流水线。
第一个岗位是分解器,负责将用户提交的文字描述转化为那份结构化的语义规范。它的工作是梳理出用户描述中所有显性和隐性的要求,并填入档案。
第二个岗位是综合器,任务是根据当前档案的状态,将其中已确定的信息整合成一段连贯、详细的描述,以便直接交给图像生成引擎使用。这好比将确认无误的施工图纸,汇总成清晰的施工任务书。
第三个岗位是生成器,负责真正生成或编辑图像。它接收任务书,产出图像。
第四个岗位是验证器,充当流水线中的“质检员”。它拿到生成的图像后,并非笼统评价,而是逐条核对档案中的每个实体和约束,给出“通过”、“失败”或“不确定”的判断,并附上原因。
这四个岗位形成一个闭环:如果验证全部通过,任务完成;如果有条目失败,流程则进入下一轮迭代,调动相应技能修复问题,再次经历综合、生成、验证的循环。整个流程最多运行三轮。
四、三种关键技能:查资料、推理、修图
仅有流水线还不够,因为有些问题流水线本身无法解决。为此,研究团队为SCOPE设计了三种可根据情况灵活调用的条件技能。重要的是,这些技能的调用都严格锚定在档案里具体的待解决或已失败条目上,绝非无的放矢。
第一种是检索技能,对应“缺信息”的情况。当档案记录显示某个承诺依赖的外部证据尚未找到时(例如需要查询真实游戏角色的确切外观),检索技能便被激活,通过搜索引擎等工具获取资料,并将结果写回档案。
第二种是推理技能,对应“信息不明确”的情况。有时用户的描述隐含了某些要求,无需查外部资料,但需通过逻辑推断才能确定具体内容。推理技能负责厘清这类模糊或隐性的承诺。
第三种是修复技能,对应“已生成但验证失败”的情况。当验证器发现某个已被明确规定的承诺未在图像中满足时,修复技能登场。它并非简单地重新生成整张图,而是根据失败的具体性质,选择三种策略中最合适的一种:若任务书描述不准确,则重写任务书;若仅是图像局部瑕疵,则进行局部编辑;若问题范围太广或太根本,则整体重新生成。这种“哪里出问题修哪里”的精准策略,效率远高于无差别重做。
这三种技能的设计逻辑体现了SCOPE的核心哲学:每一次技能调用都有明确缘由,都对应档案中的一个具体问题条目,调用结果也会写回档案,供后续环节利用。技能不是随手可用的工具,而是被精确派遣处理特定承诺问题的专家。
五、Gen-Arena:怎么才算“真正兑现了承诺”
有了SCOPE系统,下一个问题便是:如何评价它的表现?研究团队发现,现有的AI图像生成评测标准存在一个根本缺陷——它们太“宽容”了。要么给图像整体打一个匹配度分数,要么给一堆独立检查项分别打分,却忽略了这些检查项之间的逻辑依存关系。
这好比在餐厅点菜,服务员端上的菜里有三道是你点的、两道不是你点的,厨师却以“总体满足度还不错”为由辩解。然而,缺席的那两道菜可能恰恰是宴席的主菜,没有它们,其他配菜再精彩也失去了意义。
为了建立一个能真实反映“承诺是否被兑现”的严格评测标准,研究团队构建了一个全新的人工标注基准测试集,命名为Gen-Arena。
Gen-Arena包含300个测试实例,覆盖卡通、游戏、体育、娱乐、竞技和典礼六个类别。每个实例配有一段自然语言提示词,并由人工标注者精心整理出配套的结构化评测规范,明确列出图像中必须出现的所有目标实体及针对它们的原子约束。整个数据集共包含1954个实体和2533条约束,并为310个需要精确匹配真实IP角色外观的实例提供了参考图片。
评测方法称为实体门控意图通过率。其逻辑非常直观:首先检查图像中所有必须出现的实体是否都已正确呈现;只有当所有实体都通过检查,才进一步核查那些依赖于这些实体的具体约束是否被满足;最终,只有全部实体和全部约束都通过,该实例才算整体通过。任何一个实体缺席或画错,整个实例直接判为失败,不考虑其他部分做得多好。
这种“一票否决”的严格标准,正是为了对抗那种“整体上还凑合”的虚假成功感。研究团队认为,如果你要求画的是《侠盗猎车手》里的特定角色,而这个角色没出现或被替换,那么无论背景多美、构图多精彩,这张图都是失败的。
六、实验结果:数字说明了什么
SCOPE在Gen-Arena上的表现,让这个领域的其他竞争者相形见绌。在这场严格的承诺兑现测试中,绝大多数直接生成型AI的得分接近于零。
具体来看:Janus-Pro-7B、SDXL、PixArt-Sigma的整体得分均为0.00,意味着在300个严格要求下,它们几乎从未完整兑现所有承诺;FLUX.1-dev得分为0.01,SD-3.5-large为0.00,Qwen-Image为0.02,Z-Image-Turbo为0.01。即便是表现最好的直接生成模型Nano Banana Pro,得分也只有0.21。换句话说,在每五个复杂图像生成任务中,它大约只有一个能完整兑现所有承诺。
相比之下,SCOPE的整体得分达到了0.60,是Nano Banana Pro的近三倍,比第二名高出39个百分点。在六个类别中,体育和典礼两个类别的表现尤为突出,分别达到0.72和0.74。这两个类别的任务通常涉及真实的人物身份识别、特定的赛事关系以及精确的场景构图,而这正是SCOPE通过检索和推理技能最能发挥优势的场景。
更细粒度的诊断数据揭示了更深层的问题。在实体单项通过率上,Qwen-Image和Z-Image-Turbo其实不差,分别达到0.83和0.84,意味着它们大多数实体单独来看是画出来了的。但它们的整体得分却接近于零,这说明问题在于“单独看每个实体还行,但要所有实体和所有约束同时全部通过,就几乎不可能了”。这印证了“严格承诺兑现”这一目标的难度:单个元素的准确率高,并不等于整体满足度高。SCOPE将实体通过率提升到0.92,约束通过率提升到0.83,两者共同作用,才带来了0.60的整体高分。
在外部基准测试上,SCOPE同样表现出色。在测试世界知识密集型图像生成能力的WISE-V基准上,SCOPE获得了0.907的综合分,六个子类别中五个排名第一,整体比Nano Banana Pro高出3.5%;在测试知识与推理密集型视觉生成的MindBench上,SCOPE获得0.61的综合分,比Nano Banana Pro高出近49%。这些结果表明,SCOPE的承诺追踪机制并非只对特定评测有效,而是具有更广泛的通用价值。
七、消融实验:把每块积木抽掉,看哪个最关键
为了弄清SCOPE各个组件的贡献,研究团队进行了一系列消融实验,相当于把整套系统拆开,逐一关闭某些功能,观察效果变化。
将SCOPE简化为最原始的单次直接生成,得分为0.21。如果给它三次独立生成的机会并挑选最好的一次,得分提升到0.40——这说明多次尝试有价值,但提升幅度有限。用一种称为“自我改进”的方式替换SCOPE(同样有三次生成机会,但没有结构化的承诺档案,仅用自由形式的批评来重写描述),得分为0.39,甚至比“挑最好一次”的策略还低。这表明,没有结构化承诺档案作为支撑,即便有迭代修改的机会,也难以将局部改进累积为整体成功。
在SCOPE内部,若关闭检索和推理技能(仅保留分解和修复),得分暴跌至0.22,几乎与单次直接生成一样差。这有力地说明:光有结构化分解,而没有技能来填充那些“未解决信息”,承诺档案充其量是一份空白的待办清单,无法帮助生成更好的图像。若单独关闭修复技能(保留检索和推理),得分为0.42——比没有检索推理时高出一大截,但比完整SCOPE的0.60低了18个百分点。这说明检索和推理技能负责在生成前解决“我不知道该画什么”的问题,而修复技能负责解决“生成后发现画错了”的问题,两者缺一不可,相辅相成。
八、系统的边界:诚实面对不足
研究团队并未只谈成绩,他们也坦率指出了SCOPE目前存在的两个主要局限。
第一个局限是效率成本。SCOPE需要在每次生成任务中调用多次大型语言模型、图像生成引擎、验证器,并可能调用搜索引擎,最多运行三轮迭代。与直接输入描述、一次出图的方式相比,SCOPE的时间成本和计算开销要高得多。这在追求实时响应的应用场景中是一个实际障碍。研究团队提出,未来可以通过更智能的“早停”策略或更有选择性的技能调用来降低开销,但这仍是留给未来工作的课题。
第二个局限是验证器的可靠性。整个SCOPE系统的修复逻辑高度依赖验证器的判断:验证器说某个实体或约束失败了,系统才会去修复它;验证器说通过了,系统就认为没问题。但验证器本身并非完美——它可能将正确的元素误判为失败(假阴性),触发不必要的修复;也可能将画错的元素误判为通过(假阳性),导致真正的问题被忽略。验证器的精准度直接决定了整套修复机制的有效性,这是一个亟需进一步改进的薄弱环节。
归根结底,SCOPE的成就可以用一句话概括:它让AI在生成复杂图像时,不再仅仅是“努力把话听进去”,而是真正做到了“从头到尾记住并核对每一个承诺”。通过建立一份活的承诺档案、设计精准匹配问题类型的三种技能、搭配严格的逐项验证机制,SCOPE为那些原本会因复杂度而“跑偏”的图像生成任务,提供了一条更可靠的完成路径。
得分从0.21跃升至0.60,背后并非魔法,而是一套系统性地减少“信息在传递过程中丢失或漂移”的工程方案。当然,更高的准确率代价是更高的计算成本,而验证器自身的局限也提醒我们,这条路仍有很长的距离要走。但方向是清晰的:对于那些真正需要“所有细节都对”才算成功的复杂图像生成需求,单纯依赖生成模型的“理解力”和“运气”已经不够了,需要更明确的流程管理和承诺追踪机制介入其中。
Q&A
Q1:SCOPE和普通的AI图像生成有什么本质区别?
A:普通AI图像生成是“一次性把话翻译成图”,缺乏系统性的机制来追踪用户要求是否被满足。SCOPE的核心区别在于引入了一份“活的承诺档案”,将用户的所有具体要求分解为可追踪的条目,并在整个生成流程(包括查资料、生成、核查、修复)的每个环节都参照这份档案进行操作,确保每个条目的状态始终可识别、可管理。
Q2:EGIP评测标准为什么对所有基线模型得分都极低?
A:EGIP采用“全部通过才算通过”的严格逻辑。一张图像中,只要有任何一个必须出现的实体缺席或画错,整个实例就直接判为失败,无论其他部分做得多好。这个标准揭示了一个现实:大多数模型生成单个元素的能力尚可,但在同一张图像中同时满足所有实体和所有约束,成功率极低。
Q3:Gen-Arena基准测试集覆盖了哪些类型的图像生成任务?
A:Gen-Arena包含300个人工标注的实例,涵盖六个类别:卡通、游戏、体育、娱乐、竞技和典礼。每个实例都配有自然语言提示词和结构化的评测规范。整个数据集共包含1954个实体和2533条约束,其中310个实例还附有参考图片,专门用于那些需要精确匹配真实IP角色外观的任务。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















