谷歌 Gemini 3 Flash 新增“Agentic Vision”功能:将视觉推理与代码执行相结合
谷歌Gemini3Flash推出AgenticVision模块,采用“规划、干预、复验”闭环流程,将视觉推理与动态代码执行结合,对图像进行深度解析,避免单次快照的漏检问题。该功能使复杂图像任务准确率提升5%至10%,已集成于AIStudio和VertexAI平台,开发者可通过API调用。
谷歌最近放出了一个重磅更新:Gemini 3 Flash 上的全新视觉模块 Agentic Vision。它的目标很明确——让 AI 在理解图像时,不再只是“扫一眼就下结论”,而是像人类专家那样,一步步仔细推敲。

一直以来,大多数 AI 视觉模型走的都是“单次快照”路线:丢进一张图,模型立马给出判定。这在简单场景下还好,但一旦碰到高密度信息或是极细微的特征——比如远处的小字、微缩标识——这种静态方式就容易出岔子,漏掉关键细节。
Agentic Vision 的厉害之处,在于它构建了一套类似人类推理的视觉工作流。模型不再是“被动看图”,而是像专业技术人员那样,用“规划→干预→复验”的闭环方式,对图像进行深度解析。

- Think(规划):模型拿到用户指令和原始图像后,会自己生成一套分阶段的视觉分析策略——就像一个研究员先想好怎么下手。
- Act(干预):接着,通过动态编写并运行 Python 脚本,来执行裁剪、校正角度、标记区域、计数对象等精准操作——相当于亲自上手调整工具。
- Observe(复验):最后,把处理过的图像作为新输入放回上下文,模型基于更清晰的视觉证据再做二次推理,给出最终答案。
这种“观察→操作→再观察”的迭代推理,让 Gemini 在多种复杂图像任务上的准确率平均提升了 5–10%,效果相当实在。

目前 Agentic Vision 已经集成到 Gemini AI Studio 和 Vertex AI 平台,开发者通过 Gemini API 就能调用。后续它还会出现在 Gemini App 的“Thinking 模式”中,面向终端用户开放。开发者只需在相关工具中开启“代码执行”选项,就能激活这个能力。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















