Google I/O盘点:两大新模型上线,音频眼镜登台,Gemini接管一切
2026年GoogleI/O大会以AI为核心,推出全能多模态模型GeminiOmni及升级版Gemini3.5。AI智能体能力显著增强,Antigravity开发效率提升,搜索引入生成式交互界面。个人智能体GeminiSpark实现跨应用自动化,将于今夏登陆Chrome。音频智能眼镜首次亮相,具备视觉与多模态输入能力。谷歌通过Gemini深度整合Androi
北京时间2026年5月20日凌晨,备受瞩目的Google I/O开发者大会终于拉开帷幕。这一次,情况有些不同:由于Android 17的主要新功能已通过The Android Show提前“剧透”,AI毫无悬念地成为了本届大会的绝对主角。
不过,谷歌的AI叙事有其独特之处。它手握Gemini大模型、YouTube、网页搜索、Android操作系统等多个重量级生态入口。因此,本届大会的核心议题并非单纯展示AI技术有多强大,而在于回答一个更关键的问题:如何用AI为这些庞大的既有生态“赋能”,并让它们彼此协同,产生化学反应?
Gemini Omni、Gemini 3.5:新模型让 Google AI 更全能
模型能力的进化永远是基础。大会上,谷歌正式推出了号称“最全能”的新模型——Gemini Omni。它究竟有多全能?一句话概括:它能处理任何形式的输入,并生成任何形式的输出。更重要的是,整个生成过程支持以对话形式进行实时修改,交互体验堪称丝滑。

图片来源:Google
以制作一段MV为例,你只需将音乐、视频片段、图片素材以及对画面的描述一股脑儿“喂”给Gemini Omni,它就能直接输出一个完整的短视频。现场演示的一个案例更是夸张:在一张白纸上随手画个圆圈,再配上一句文字描述,Gemini Omni就能生成一段特效视频。如果对其中某个元素不满意,比如觉得“玻璃建筑太生硬”,只需说一句“把它换成肥皂泡”,模型就能精准替换,新生成的肥皂泡甚至拥有逼真的物理碰撞效果。

图片来源:Google
用谷歌自己的话说,“Gemini Omni就像是视频领域的‘万能瑞士军刀’”。据悉,Gemini Omni Flash模型即日起将在Gemini App、Google Flow、YouTube Shorts等平台上线,其API也将随后向开发者开放。

图片来源:Google
除了这位“全能选手”,Gemini家族也迎来了版本升级——Gemini 3.5。其中,轻量级的Gemini 3.5 Flash在编程、现实环境智能体任务、大规模工具调用等测试中,表现均优于前代Gemini 3.1 Pro。当然,按照惯例,有Flash就必然有更强大的Pro版本。谷歌已预告Gemini 3.5 Pro将于下个月亮相。可以说,在模型能力上,谷歌这次把“多、快、好、省”四个字,几乎全占齐了。
Google Antigra vity、Gemini Spark:更快、更强的智能体
底层模型变强了,基于其构建的AI智能体(Agent)自然水涨船高。

图片来源:Google
在开发者侧,谷歌的AI开发环境Antigra vity现已集成Gemini 3.5 Flash。根据演示,借助新模型的能力,Antigra vity仅用12小时就搭建了一个操作系统内核,而整个过程的AI API成本甚至不到一千美元。这效率与成本控制,足以让不少开发团队心动。

图片来源:Google
更令人印象深刻的是,谷歌甚至用这套工具重构了搜索的交互界面,提出了“生成式UI”的新概念。目前,即便在搜索页面开启AI模式,结果也大多以文本对话框的形式呈现。这对于简单问答足够,但遇到“陀飞轮是如何工作的?”这类需要直观演示的问题时,纯文本就显得力不从心了。

图片来源:Google
于是,全新的Google搜索AI学会了“Vibe Coding”——面对复杂查询时,它能直接生成一个可交互的前端网页,让用户通过点击、拖拽等方式直观地获取答案。这项功能预计在今年夏季上线,而且它将作为Google搜索的更新免费提供,无需订阅Gemini高级服务。同时,Gemini App本身的界面也获得了更新,与Android的新视觉语言更加统一。

图片来源:Google
得益于多模态能力的提升,新版搜索的输入方式也更多样,现已支持直接上传视频或文档进行分析。而搜索推荐和补全功能,也从过去的大数据排序,升级为基于Gemini 3.5 Flash的智能预测。

图片来源:Google
除了这些“前台”变化,搜索智能体的“后台”能力也被大幅强化。全新的搜索Agent可以全天候运行,持续监控用户指定的信息。例如,你可以让它紧盯OpenAI、Anthropic等竞争对手的动态,一旦有重大新闻,立即通过邮件或通知提醒你,堪称信息领域的“私人哨兵”。
说到智能体,大会上最引人注目的发布莫过于面向个人用户的Gemini Spark。与其他AI助手一样,它能7×24小时接管你的手机和浏览器。但关键区别在于,Gemini Spark运行在一个专门的虚拟化环境中,安全性更高。它显然由Gemini 3.5 Flash和Antigra vity驱动,支持语音交互和后台响应。

图片来源:Google
在生态联动上,Gemini Spark不仅能无缝调用Google Docs、Calendar、Gmail等自家服务,还能通过MCP协议与外部应用互联,实现真正跨应用的复杂任务自动化。谷歌未明确说明其平台适配计划,但预计会通过Gemini App(iOS)和深度集成于系统层的组件(Android)登陆移动设备。

图片来源:Google
当智能体在后台运行时,Android系统新增的“Halo”功能会在屏幕左上角常驻一个状态标记,方便用户随时查看或跳转。这个设计,与当前手机提示摄像头、麦克风被调用的指示灯异曲同工。这或许暗示着,在谷歌的蓝图里,AI智能体的地位已与摄像头、麦克风等核心传感器同等重要,成为智能设备不可或缺的基础能力。

图片来源:Google
至于桌面端,Gemini Spark将于今夏登陆Chrome浏览器。不过,如此强大的能力并非免费午餐。Gemini Spark是订阅制服务,下周将率先面向Google AI Ultra订阅用户开放。值得注意的是,谷歌在原有的AI Pro(20美元/月)和AI Ultra(250美元/月,限时200美元)之间,新增了一个“青春版”AI Ultra档位(100美元/月),以区分企业用户和高用量个人用户。

图片来源:Google
这释放出一个清晰信号:即便强如谷歌,也难以完全承担全面AI化带来的巨额算力成本。AI的尽头是算力,而算力的尽头是真金白银的投入。可以预见,随着AI智能体能力日益深入日常生活,付费AI服务很可能像手机话费一样,逐渐成为一种“刚性消费”。
音频眼镜首次登台,Gemini 生态日渐完善
去年,谷歌展示了带显示功能的AR眼镜原型。今年,其“音频版”智能眼镜首次登台。别被名字误导,这款Gemini眼镜并非单纯的耳机替代品,它配备了摄像头,具备完整的AI视觉和多模态输入能力。
由于产品要等到今年秋季才发布(很可能为了适配高通新一代芯片),谷歌并未公布重量、传感器、续航等具体参数,仅展示了外观和核心功能。

图片来源:Google
设计上,谷歌选择了与三星及Gentle Monster、Warby Parker等知名眼镜品牌合作。功能上,用户可通过语音或镜腿上的触控板唤醒Gemini。借助底层模型和Spark智能体的能力,眼镜能将用户的语音指令自动分解为一系列操作,并在手机后台执行。例如,说一句“买一杯上次点的咖啡”,手机上的Gemini就能自动打开咖啡App、添加商品、并最终在用户语音确认(很可能采用声纹验证)后完成支付。

图片来源:Google
值得一提的是,谷歌确认这款眼镜将同时支持Android和iOS平台。不过,在iOS严格的沙盒机制下,其在iPhone上的能力势必会大打折扣。
为了进一步拓展Gemini的能力边界,谷歌办公套件(Google Workspace)也全面接入了AI。用户可以通过语音,让Gemini在Gmail中查找邮件、在Docs中辅助写作、甚至在Google Pics中生成图像。

图片来源:Google
结合此前曝光的、可能搭载Gemini的“Googlebook”高端笔记本,可以看出,谷歌正不遗余力地将Gemini嵌入其所能掌控的每一个硬件生态位。
主题演讲至此告一段落。或许有人会认为,这不过是谷歌在AI竞赛中后发制人的“画饼”之举。但深入剖析,Google I/O 2026所揭示的,恰恰是谷歌终于找到了打开AI时代大门的那把钥匙。
针对“AI交互该如何进行”这个根本问题,谷歌甚至向自己的“发家业务”开刀,用“生成式UI”彻底改变了AIGC传统的“回合制”对话模式。这种从单向输出到双向、动态交互的转变,同样体现在Gemini硬件上。过去,AI硬件常常是“硬件归硬件,AI归AI”,两者割裂。而如今,Gemini 3.5 Flash的多模态能力,让音频眼镜等设备真正成为了AI感知世界的“物理器官”。

图片来源:Google
更重要的是,Gemini正利用其在Android系统中的原生优势,构筑一道其他厂商难以逾越的护城河。当其他AI智能体还在为跨应用操作苦苦寻找解决方案时,Gemini已经能在Android底层实现畅通无阻的系统级联动。
回顾开头提到的,谷歌手握多个生态入口的优势,在本次大会上终于看到了“开花结果”的迹象。Gemini如同一条主动脉,将这些分散的生态器官紧密连接,形成了一个协同运作的有机体。
当然,Gemini高度依赖谷歌生态,这对OpenAI、Grok等对手是巨大挑战,但也为其他市场(尤其是中国市场)的玩家指明了道路,并留下了机遇。Gemini的全家桶模式在国内难免“水土不服”,但其“多模态输入输出+深度系统集成+全天候智能体”的核心逻辑极具参考价值。海外有谷歌在原生安卓上大刀阔斧,国内厂商同样可以在定制化系统上构建自己的“AI王国”。
更重要的是,中国品牌在智能体本土化落地和生态整合上的激进程度与务实精神,往往更胜一筹。Google I/O 2026,谷歌亮出了Gemini的底牌。接下来,舞台的聚光灯将转向国内,看各大AI巨头与手机厂商如何强强联手,在这场全球AI生态竞赛中,走出自己的“破局”之路。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















