谷歌Gemini三箭齐发,Flash降价提效、网络安全模型直指Anthropic,旗舰3.5 Pro仍难产
谷歌发布三款AI模型:Gemini3.6Flash降低输出成本与Token消耗,Flash-Lite高吞吐低延迟,FlashCyber专攻网络安全直指Anthropic。旗舰Gemini3.5Pro仍延期,Gemini4已启动预训练。
谷歌又一次调整了AI军备竞赛的焦点。这一次,重心从单纯追求更大、更强的旗舰模型,转向了更便宜、更快、更适合大规模部署的AI智能体。

美东时间周二,谷歌一口气推出了三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全的Gemini 3.5 Flash Cyber。其中,Gemini 3.6 Flash主打代码、知识工作和多模态任务,在减少输出Token消耗的同时,价格也比上一代更低;Flash-Lite则瞄准了高吞吐、低延迟的场景;而Flash Cyber通过CodeMender代码安全智能体,试图以更低成本切入网络安全AI市场,这个动作值得关注。
先说价格。Gemini 3.6 Flash的输出价格相比前代3.5 Flash下调了约17%,但并非所有新模型都明面上降价了。Gemini 3.5 Flash-Lite的核心策略是,通过更快的响应速度和更高的任务效率,来降低高吞吐场景下的整体使用成本。如果只看名义Token价格,它比上一代Gemini 3.1 Flash-Lite并没有下降,输出价格反而更高了。
所以,这次谷歌AI产品策略的核心,与其说是全面“价格战”,不如说是通过模型分层,在模型能力、Token消耗、响应速度和实际任务成本之间,寻找一个新的平衡点。
不过,这次发布也暴露了谷歌当前AI战略的一个尴尬之处:市场最期待的旗舰模型Gemini 3.5 Pro,仍然没有正式发布。据路透社报道,该模型原定于6月推出,目前还在与合作伙伴测试中,谷歌只表示将在“准备好后”尽快扩大开放。与此同时,谷歌已经启动了迄今为止最雄心勃勃的Gemini 4预训练工作。
在OpenAI和Anthropic持续推出更强大模型的背景下,AI企业客户开始越来越关注推理成本和Token效率。谷歌这次发布的三款模型,更像是一次围绕“AI智能体商业化”的全面补位。
Gemini 3.6 Flash:代码与智能体能力同步提升,成本却下来了
核心更新是Gemini 3.6 Flash。按照谷歌的说法,它是在Gemini 3.5 Flash基础上,根据开发者和企业客户反馈进行优化的“工作马”模型,重点提升了代码编程、知识工作和多模态能力。
更值得关注的是效率。谷歌引用Artificial Analysis Index的数据称,Gemini 3.6 Flash相比3.5 Flash,输出Token消耗减少了17%,同时完成多步骤工作流所需的推理步骤和工具调用次数也有所减少。对于需要长时间运行、反复调用工具的AI智能体来说,这意味着成本不单单是按Token价格下降,整个任务的计算量都有望减少。
价格方面,Gemini 3.6 Flash的输入价格为1.5美元/百万Token,输出价格为7.5美元/百万Token,较前代3.5 Flash的9美元/百万Token输出价,低了将近17%。
从谷歌公布的测试数据来看,3.6 Flash在多个关键指标上比3.5 Flash有明显提升:DeepSWE从37%提升到49%,MLE Bench从49.7%提升到63.9%,OSWorld-Verified从78.4%提升到83%,GDPval-AA v2从1349分提升到1421分。OSWorld-Verified主要测试模型使用计算机完成实际任务的能力,GDPval-AA则更偏向现实世界的知识工作任务。
谷歌强调,3.6 Flash能够减少不必要的代码修改和执行循环,从而生成更高质量、更接近生产环境要求的代码。
这其实是AI模型竞争正在发生变化的一个缩影。早期,市场更关注模型能否在数学、知识问答和综合基准测试中取得更高分数。但随着企业开始真正部署AI智能体,模型每多调用一次工具、每多生成一段无效Token,都可能转化为实际成本。因此,“单位智能的成本”正在成为AI模型竞争的新战场。
Flash-Lite:每秒350个Token,专为规模化而生
如果说3.6 Flash针对的是复杂任务,那么Gemini 3.5 Flash-Lite的目标更加明确:规模化。谷歌将其定位为Gemini 3.5系列中速度最快、成本效率最高的模型,适用于智能搜索、文档处理以及其他高吞吐、低延迟任务。
根据Artificial Analysis的数据,Flash-Lite的输出速度达到了每秒350个Token。价格则进一步下探至:输入定价0.30美元/百万Token,输出2.50美元/百万Token。这意味着,在大量文档总结、分类、信息抽取以及AI搜索等高频任务中,开发者可以使用更便宜的模型处理海量请求,而不必让更昂贵的旗舰模型承担所有工作。
测试数据显示,Flash-Lite相比此前的3.1 Flash-Lite,在Terminal-Bench 2.1上的成绩从31%提高至54%,GDM-MRCR v2从60.1%提高至72.2%,GDPval-AA v2从642分提高至1140分。更值得注意的是,谷歌称,3.5 Flash-Lite在部分测试中甚至超过了更高一级的Gemini 3 Flash,包括SWE-Bench Pro和OSWorld-Verified。
这背后反映的是谷歌对未来AI应用架构的一个判断:未来的AI智能体可能不会由一个超级模型独立完成所有工作,而是由多个不同成本、不同能力的模型协同完成。一个较强的“主智能体”负责规划和决策,多个便宜、快速的“子智能体”负责搜索、整理、调用工具和执行重复性任务。在这种架构下,模型的速度和成本效率,可能比单纯的最高基准分数更加重要。
网络安全专用模型,正面迎战Anthropic
此次发布中最具战略意味的产品,可能是Gemini 3.5 Flash Cyber。谷歌表示,该模型专门用于发现、验证和修复代码安全漏洞,并与其CodeMender代码安全智能体结合使用。在CodeMender体系中,多个Gemini 3.5 Flash Cyber智能体可以协同工作,最终形成综合安全报告。
Flash Cyber的设计目标很明确:在低于大型模型的每Token成本下,实现具有竞争力的网络安全能力。这显然是瞄准了一个正在快速升温的AI应用市场。随着AI模型越来越擅长生成代码,企业面临的一个新问题是:AI生成代码的速度可能已经超过人类安全团队审查和修复漏洞的速度。因此,能够自动扫描代码、发现漏洞、验证漏洞并生成修复方案的AI安全智能体,正在成为企业AI应用的重要方向。
谷歌此次将Flash Cyber与CodeMender结合,实际上是在尝试打造一个“低成本、可规模化”的自动化安全防御系统。不过,由于网络安全AI具有明显的双重用途属性,Flash Cyber初期将仅通过有限访问试点向政府和受信任合作伙伴提供,而不是直接全面开放。
路透社指出,谷歌当前正面临Anthropic和OpenAI的竞争压力。Anthropic近期推出了更强大的Mythos 5和Fable 5模型,OpenAI也推出了GPT-5.6。其中,Anthropic最新模型的网络安全能力尤其受到市场关注。因此,谷歌推出Flash Cyber的意义,不仅在于发布一个垂直领域模型,也是在试图证明:在AI安全领域,企业不一定需要使用最昂贵、最大的模型。如果一个更小、更快、更便宜的模型能够完成大部分漏洞检测和修复任务,那么企业部署AI安全工具的成本就可能显著下降。
旗舰Gemini 3.5 Pro仍然延期,谷歌已经开始训练Gemini 4
不过,谷歌此次密集推出Flash系列,并没有完全消除市场对旗舰模型的疑问。Gemini 3.5 Pro原计划于今年6月发布,但目前仍然处于与合作伙伴测试阶段。路透社援引知情人士称,Gemini 3.5 Pro延期的一个重要原因,是其在内部测试中尤其是在代码任务上的表现没有达到预期。而代码能力恰恰是目前企业AI市场增长最快、商业价值最高的应用场景之一。
这也解释了为什么谷歌在Gemini 3.5 Pro仍未发布的情况下,选择继续加码Flash系列。一方面,Flash模型能够迅速覆盖开发者和企业客户;另一方面,谷歌也可以通过更低的价格,扩大Gemini模型的实际调用规模。Alphabet CEO皮查伊此前曾强调,企业如果将大部分AI工作负载转移至Gemini模型,每年可能节省超过10亿美元。路透社称,谷歌近期也在持续强调Gemini模型的成本优势。
但从竞争格局看,谷歌面临的压力依然不小。去年Gemini 3系列发布时,谷歌一度重新回到AI竞争的第一梯队,并迫使OpenAI内部发出“红色警报”。然而,此后Anthropic和OpenAI继续推出更强大的模型,谷歌的旗舰产品却出现延期。
如今,谷歌的战略开始出现明显分层:Gemini 3.6 Flash负责效率,Flash-Lite负责规模,Flash Cyber负责垂直场景,而Gemini 3.5 Pro则承担重新证明谷歌顶级模型能力的任务。更大的悬念在于Gemini 4。谷歌此次透露,Gemini 4已经启动了“迄今最雄心勃勃的预训练工作”。这意味着,谷歌正在一边修补Gemini 3.5 Pro的延期问题,一边加速下一代旗舰模型的研发。
对于Alphabet而言,真正的考验已经不只是“能否发布一个更强的模型”,而是能否同时解决三个问题:模型能力能否追上OpenAI和Anthropic;模型成本能否足够低;以及AI模型能否真正转化为搜索、云计算和企业软件业务的收入增长。从这次三款新模型的发布来看,谷歌正在把“更强模型”的竞争,进一步转向“更高性价比的AI基础设施”竞争。但在Gemini 3.5 Pro正式亮相之前,市场恐怕仍会继续追问:谷歌能否再次拿出一个足以改变AI竞争格局的旗舰模型。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















