发布于2026-07-31 阅读(0)
扫一扫,手机访问
提示工程(prompt engineering)已经成了提升语言模型性能的一个关键手段。业内现在的共识是:只要模型的输入空间足够丰富,就一定存在通过优化输入来获得更好下游性能的机会。
那么,这一原理是语言模型专属的,还是说也能跨出这个边界——比如,延伸到视觉领域?
Google DeepMind 在一篇新论文中给出了答案,他们提出了“视觉提示工程”(visual prompt engineering,VIPE),正式把提示工程这套方法论搬到了视觉领域。

实验结果表明,视觉提示工程在多个任务上都能有效提升视频推理性能。而且,对视频模型来说,它有时候甚至比经典的文本提示工程或 test-time scaling 更管用。
就像文本提示工程能系统性提升语言模型的表现一样,视觉提示工程同样提供了一种简单、计算高效的手段,用来激发视频模型更好的视觉推理能力。
研究团队认为,这指向了一种新的范式:视觉提示本身,也可以像文本提示一样被优化。随着前沿视频模型开始接收更丰富的多模态上下文,视觉提示工程或许会从单张图像编辑,扩展到多张参考图像甚至视频。
视觉提示工程,本质上就是针对视频模型视觉输入的提示工程方法。它不改变任务本身的逻辑,而是把原始图像转换成模型更容易理解和推理的视觉形式——让模型能在全新的视觉场景中,去处理同一个问题。举个例子,一张抽象的球和斜坡示意图,可以改写成写实的台球和木板场景,只要关键的空间关系保持一致就行。

图|视觉提示工程从一个视觉提示开始,比如一张球和斜坡的草图图像,以及“球沿着……滚下,最后落入其中一个桶里”这样的文本提示。
具体流程分三步:
1. 构想器:负责想清楚图像该怎么改。它会根据任务样本和约束条件,生成一段自然语言编辑指令,指令里明确标注哪些任务相关元素必须保留,比如物体的数量、位置、朝向和相对关系。
2. 编辑器:按编辑指令修改原图,生成一个或多个候选图像。这个步骤可以由图像编辑模型完成,也可以由人工编辑完成。
3. 筛选器:这是一个可选步骤。当编辑器生成多个候选图时,筛选器会从中挑出更合适的版本,优先选择图像质量更好、同时保留了原图任务关键信息的那个。
研究团队在 VPCT 物理推理任务上测试并验证了自动化视觉提示工程。整体来看,视觉提示工程确实能提升视频模型的视觉推理表现,而且,优化视觉上下文通常比优化文本指令更有效。
使用视觉提示工程后,Veo 3.1 的准确率从 41.3% 提升到了 59.3%,Omni Flash 从 56.3% 提升到了 67.5%。视频模型显然系统性地偏好照片级真实的上下文,而非抽象输入。

图|视觉提示工程提升了 VPCT 上的物理推理能力。
视觉提示工程的自动化流程,由视觉-语言模型(VLM)生成改写指令,图像编辑模型生成候选图,自动评分器负责筛选或反馈迭代。研究团队比较了自由形式构想和原子概念编辑(ACE)两条路线,结果发现两种方法都能自动生成更好的改写图像;自由形式视觉提示工程在部分任务上甚至把错误率降低了超过 75%。而 ACE 在 Sort 3 Numbers 任务上,如果按样本选择最佳视觉版本,错误率可以降为 0。

图|自动化视觉提示工程在多种任务上都能提升性能。
在小球滚落物理推理任务中,未使用视觉提示工程时,Veo 3.1 通过多次采样从 41.3% 提升到 50.0%;而加入视觉提示工程后,单次采样准确率就达到了 59.3%。如果在视觉提示工程改写后的视觉提示上继续做多次采样,准确率还能进一步攀升到 68.0%。

图|视觉提示工程还可以与测试时扩展结合,进一步提升性能。
以 Sort 3 Numbers 任务为例,最优文本提示和最优图像提示的准确率分别为 86% 和 76%。

图|对于视频模型而言,视觉提示工程可能比文本提示工程更有效。
研究团队测试了 Nano BananaPro、Nano Banana 2 等模型,结果显示,把输入换成照片级真实图像后,图像模型的推理性能并没有稳定的提升。这可能是因为原生图像生成模型覆盖了更多的视觉风格,对抽象草图和真实图像都比较熟悉。

图|原生图像生成模型在 VPCT 上的结果,报告每种配置下的最佳提示结果。
这类改写能把抽象草图转换成更接近真实世界的视觉场景,从而减少抽象输入与视频模型熟悉视觉表征之间的差距。例如在 VPCT 任务上,将草图改写为照片级真实场景后,Veo 3.1 的准确率提升到了 59.3%。因此,当同一任务可以转换为更真实的视觉场景时,优先使用真实场景版本通常是更明智的选择。

图|向真实感迈出的每一步都会提升生成一致性。
当然,当前的方法也存在一定的局限性。
比如,当前的视觉提示工程方法高度依赖图像编辑模型的质量,如果编辑器改变了任务信息或者引入了伪影,下游视频模型可能就无法解决原始任务了。未来,如果图像编辑模型能更稳定地保留任务信息,额外的筛选和质量控制步骤或许就不再需要了。
同时,视觉提示工程也会带来额外的成本。不过,图像编辑通常比视频生成便宜得多,所以这项成本在实践中反而可能转化为优势——一次便宜的图像编辑调用,就能降低一次昂贵视频生成失败的概率。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9