商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 谷歌 Gemini 3 Flash 新增“Agentic Vision”功能:将视觉推理与代码执行相结合

谷歌 Gemini 3 Flash 新增“Agentic Vision”功能:将视觉推理与代码执行相结合

  发布于2026-08-16 阅读(0)

扫一扫,手机访问

谷歌最近放出了一个重磅更新:Gemini 3 Flash 上的全新视觉模块 Agentic Vision。它的目标很明确——让 AI 在理解图像时,不再只是“扫一眼就下结论”,而是像人类专家那样,一步步仔细推敲。

一直以来,大多数 AI 视觉模型走的都是“单次快照”路线:丢进一张图,模型立马给出判定。这在简单场景下还好,但一旦碰到高密度信息或是极细微的特征——比如远处的小字、微缩标识——这种静态方式就容易出岔子,漏掉关键细节。

Agentic Vision 的厉害之处,在于它构建了一套类似人类推理的视觉工作流。模型不再是“被动看图”,而是像专业技术人员那样,用“规划→干预→复验”的闭环方式,对图像进行深度解析。

  1. Think(规划):模型拿到用户指令和原始图像后,会自己生成一套分阶段的视觉分析策略——就像一个研究员先想好怎么下手。
  2. Act(干预):接着,通过动态编写并运行 Python 脚本,来执行裁剪、校正角度、标记区域、计数对象等精准操作——相当于亲自上手调整工具。
  3. Observe(复验):最后,把处理过的图像作为新输入放回上下文,模型基于更清晰的视觉证据再做二次推理,给出最终答案。

这种“观察→操作→再观察”的迭代推理,让 Gemini 在多种复杂图像任务上的准确率平均提升了 5–10%,效果相当实在。

目前 Agentic Vision 已经集成到 Gemini AI Studio 和 Vertex AI 平台,开发者通过 Gemini API 就能调用。后续它还会出现在 Gemini App 的“Thinking 模式”中,面向终端用户开放。开发者只需在相关工具中开启“代码执行”选项,就能激活这个能力。

本文转载于:https://www.php.cn/faq/2040978.html?uid=1246273 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注