Google DeepMind 于 2026 年 7 月 21 日发布了三个新的 Gemini 模型,为开发人员大规模构建 AI 代理提供了强大的阵容。该公司推出了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及名为 Gemini 3.5 Flash Cyber​​ 的专用网络安全模型。然而,大多数观察者都在等待的更新尚未发布:谷歌旗舰产品 Gemini Pro 的下一个版本。要了解更多 突发人工智能新闻 和前沿模型竞赛的分析,下面的故事详细介绍了哪些内容已发货、哪些内容有所下滑,以及它们为何重要。

三种新的闪存模型目标效率和代理

Gemini 3.6 Flash 被定位为 Google 的“主力模型”,旨在改进编码、知识工作和多模式性能,同时与前身相比,将令牌使用量减少高达 17%。据 TechCrunch 称,该模型比 Gemini 3.5 Flash 更便宜,同时在生产工作负载中提供了更强的结果。

解码器报告了与之前的 Flash 模型相比具体的基准测试增益。 DeepSWE 从 37% 上升到 49%,MLE Bench 从 49.7% 上升到 63.9%,OSWorld-Verified 代理基准从 78.4% 上升到 83%。 Google 将 3.6 Flash 定价为每百万个输入代币 1.50 美元,每百万个输出代币 7.50 美元。

Flash-Lite 压低了价格下限

Gemini 3.5 Flash-Lite 是同类产品中最具成本效益的型号,专为低延迟和高吞吐量而优化。独立评估者 Artificial Analysis 测量它每秒产生 350 个输出令牌。根据 the-decoder 的说法,每百万个输入代币的成本为 0.30 美元,每百万个输出代币的成本为 2.50 美元。谷歌表示,Flash-Lite 在多项代理和编码基准测试中击败了较旧的 3 Flash。

Flash Cyber:为寻找漏洞而构建的模型

Gemini 3.5 Flash Cyber 针对查找和修复网络安全漏洞进行了微调。谷歌已将其集成到其代码安全代理 CodeMender 中。在 Cyber​​Gym 基准测试中,Flash Cyber​​ 的得分为 83.2%,与 OpenAI 的 GPT-5.5-Cyber​​ 的 85.6% 差距仅两分,尽管它的模型要小得多。

Google 的 Big Sleep 团队部署了 Flash Cyber​​ 来查找 Chrome 和 Safari 中的严重缺陷。当扫描 V8 JavaScript 引擎中的提交时,它发现了 55 个已确认的独特发现,而标准 3.5 Flash 为 47 个,Anthropic 的 Claude Opus 4.6 为 36 个。在一项单独的测试中,谷歌的云漏洞研究团队使用该模型扫描公共 API,在两个小时内发现了远程代码执行缺陷,并产生了有效的漏洞。

由于该模型对于进攻和防御都有效,因此谷歌正在限制访问。 Flash Cyber​​ 仅通过有限的试点计划向政府和值得信赖的合作伙伴提供。

Gemini 3.5 Pro在哪里?

发布会上明显缺席的是 Gemini 3.5 Pro,这是谷歌用于复杂推理和编码的旗舰模型,最后一次更新是在 2 月份。今年 5 月,谷歌将 Pro 版与 Gemini 3.5 Flash 一起发布,称其“已经在内部使用,我们期待下个月推出”。

该时间表已被推迟。彭博社报道称,谷歌在推出 3.5 Pro 方面面临内部延迟,因为它难以实现自己的性能目标。谷歌 DeepMind 产品负责人 Logan Kilpatrick 7 月 21 日表示,该公司正在与合作伙伴一起测试 3.5 Pro,并希望“尽快落地”,但没有提供具体日期。

对手已经等不及了

竞争差距正在扩大。 TechCrunch 指出,自 Google 上次更新 Pro 以来,OpenAI 已经发布了 GPT-5.5 并开始推出 GPT-5.6,而 Anthropic 则推出了 Claude Opus 4.8、Claude Sonnet 5,并扩大了对其前沿 Fable 5 模型的访问。中国实验室也正在接近:解码器指出Moonshot的Kimi K3和Zhipu的GLM-5.2作为接近前沿性能的系统。

Gemini 4 训练正在进行中

Kilpatrick 还透露,该团队已经开始了 Gemini 4 迄今为止最雄心勃勃的预训练。the-decoder 将这一披露描述为损害控制,并指出这表明谷歌了解市场预期,但尚未交付其旗舰产品。

谷歌确实为更广泛的平台添加了新功能。 Computer Use 现在是 Gemini API 和 Gemini Enterprise 中的内置客户端工具,允许模型操作浏览器和桌面。该公司还针对化学、生物、放射性、核和网络威胁加强了边境安全保障。

这对开发人员意味着什么

对于建筑商来说,新的 Flash 型号提供了速度、价格和功能的实用组合。一百万代币上下文窗口、显示实际收益的代理基准以及积极的代币定价使 3.6 Flash 和 Flash-Lite 对于生产部署具有吸引力。与此同时,网络安全模型代表着对高风险利基市场的显着推动。

悬而未决的问题是,在其旗舰产品处于测试阶段时,谷歌能够维持推出中端机型的战略多久。随着竞争对手以稳定的节奏发布前沿系统,Gemini 3.5 Pro 及其背后的 Gemini 4 训练运行的压力只会越来越大。

保持人工智能领先地位

前沿模型竞赛进展迅速。为 AI Buzz Wire 添加书签,了解模型发布、基准测试和行业转变的每日报道。

阅读更多人工智能新闻 →