谷歌于周二推出了 Gemini 3.8 Flash,这是其最新的主力型号,定位为该公司最好的推理和编码系统,但价格与其前身相同,此外还有一个专门为防御性网络安全工作而构建的名为 Gemini 3.8 Flash Cyber​​ 的变体。该公告由产品管理高级总监 Tulsee Doshi 和 Google DeepMind Gemini 安全主管 Raluca Ada Popa 在 Google 官方博客上发布,标志着 Google 在短短六周内发布了第三个 Flash。

此次发布正值异常拥挤的发布季中期,这是对竞争对手对谷歌产品线施加的定价和性能压力的直接回应。为了更广泛地了解前沿实验室如何相互攻击,人工智能突发新闻 团队跟踪每一个主要模型的发布。

两种变体,一种基础

Gemini 3.8 有两个基于相同基础智能构建的版本。 Gemini 3.8 Flash 是通用主力:谷歌表示,它在软件工程、代理任务和专业领域的多步推理方面比 3.7 Flash 有了显着改进,推出价格为每百万输入代币 0.75 美元和每百万输出代币 3.75 美元。

Gemini 3.8 Flash Cyber​​ 被描述为 Google 最强大的网络安全模型,在漏洞检测和自动修补方面具有该公司所谓的前沿级性能。与标准 Flash 模型不同,它并不广泛可用——谷歌正在通过一个名为 Fairwind 的新程序将其分发给一组值得信赖的防御者。

根据博客文章,共享核心的编码和推理收益部分是由网络安全领域严格的训练驱动的,并且这两个模型都通过长期运行的代理循环来加速,该循环旨在递归地评估和完善底层模型。

基准:更加努力地工作,而不仅仅是变得更大

Google 的基准测试主张以该公司明确总结的设计理念为中心:3.8 Flash“更努力”。在复杂的任务上,模型会执行额外的推理步骤并迭代调用工具,有时会消耗更多的令牌以在更高的工作水平下最大化性能。开发人员可以减少工作量以减少令牌开销,或者继续使用 Gemini 3.7 Flash,它仍然完全支持效率优先的工作负载。

谷歌引用的标题结果:

  • DeepSWE v1.1(长期软件工程):3.8 Flash 在自主解决端到端复杂工程问题方面优于大多数较大的前沿模型,而 Google 称其成本仅为其一小部分。
  • Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark:3.8 Flash 在需要高级分析和报告的定量和专业领域优于 3.7 Flash 和其他前沿模型。
  • HLE 验证:3.8 Flash 达到 54.9%,谷歌将其作为跨 STEM、人文和专业领域多步推理的证据。

Flash Cyber:防御胜于进攻

Cyber 版本是更不寻常的版本。谷歌表示,它刻意优先考虑漏洞修复,而不是利用等攻击性能力。在 Colliner 运行的外部补丁基准 CWE-Bench 上,Gemini 3.8 Flash Cyber​​ 的 pass@1 得分为 47.2%,仅落后于领先的前沿模型 47.8%(据谷歌称),但成本显着降低,使其处于基准的 Pareto 前沿。

在寻找漏洞的标准行业基准 Cyber​​Gym 上,谷歌表示 Cyber​​ 模型展示了前沿级的自主漏洞发现能力,超越了其前身 3.5 Flash Cyber​​ 以及更大的前沿模型。在涵盖 20 种编程语言的复杂代码库的 Google 内部基准测试中,该模型的成功率超过 70%。

已经保护 Google 自己的代码

谷歌表示,Cyber 模型已经在内部部署,其提供的示例也很具体:

  • Chrome 安全团队发现,3.8 Flash Cyber​​ 生成的 Chrome 漏洞正确补丁数量是最佳商业模型的 2.6 倍,而且规模要大得多。
  • 在安全公司 Wiz,该模型在内部渗透测试基准上的召回率提高了 7.5 至 9.7 个百分点,而与其他领先的前沿模型相比,成本降低了 2.3 至 5.2 倍。
  • 谷歌的云漏洞研究团队使用该模型在两个小时内找到了一个关键的基础漏洞——谷歌指出,这类漏洞的研究和发现通常需要几个月的时间。

这对开发商和市场意味着什么

对于开发商来说,实际的收获是价格稳定在低端。将 3.8 Flash 保持在 3.7 的介绍性定价,使具有竞争力的编码和代理模型的成本保持在每百万代币 0.75 美元/3.75 美元,在这一领域,开放权重挑战者和竞争对手实验室全年都在削弱现有企业的实力。谷歌传达的信息是,买家不再需要在主力层的成本和功能之间进行选择。

Flash Cyber​​ 的 Fairwind 计划分发模型同样具有说服力。前沿实验室越来越多地将精英网络安全能力视为需要封闭的东西,而不是广泛传播的东西——为经过审查的防御者提供最先进的防御工具,同时限制进攻性滥用的可能性。谷歌决定在模型训练中优先考虑修补基准而不是利用能力,这也遵循相同的逻辑。

节奏也值得注意。六周内发布了三个 Flash(三周前发布了 3.7 Flash,现在发布了 3.8),这表明 Google 迭代其中端产品线的速度远远快于两年前的年度发布周期。 OpenAI 的 GPT-6 推出和来自中国的一波快速发展的开放权重模型带来的竞争压力压缩了每个人的时间线,谷歌显然在主力层选择速度,而其前沿模型则扛着研究旗帜。

3.8 Flash 的“更努力”方法(在勤奋的多步骤推理上花费更多代币)在实践中是否比原始模型规模更有效,将在未来几个月的开发者账单中体现出来。谷歌自己的基准表明,这种交易有利于勤奋;市场将一次对一项 API 法案作出裁决。

保持人工智能领先地位

每次模型发布、基准测试和价格变化都会实时跟踪 — 阅读更多人工智能新闻 →