谷歌DeepMind准备最早在周三推出新的AI模型Gemini 3.8 Flash,瞄准谷歌一直落后于竞争对手Anthropic和OpenAI的软件开发能力。 《华尔街日报》周一报道了这些计划,并援引内部测试,结果显示新模型在编码方面取得了进展——这一领域已成为前沿实验室之间竞争最激烈的战场。
该报告影响了市场:据《巴伦周刊》报道,《华尔街日报》报道后,Alphabet 股价在盘后交易中上涨。投资者一直在密切关注谷歌的编码性能,因为开发人员越来越多地围绕代理工作流程中最可靠的模型编写、调试和重构代码来选择工具。 更多相关背景,请参阅我们的AI最新动态。
##《华尔街日报》报道内容
据《华尔街日报》报道,Gemini 3.8 Flash 的内部测试显示出具体在编码方面的进展,Gemini 在这方面落后于 Anthropic 的 Claude 模型和 OpenAI 的 GPT 系列。预计本周发布,周三被认为是最早的发布日期。
框架很重要:谷歌并不声称全面超越了所有竞争对手。相反,该公司正在攻击其最明显的弱点。代理编码——人工智能模型在长时间会话中规划、编写、测试和修复多个文件中的代码——已经成为企业买家和开发工具初创公司最关心的基准,也是谷歌竞争对手建立领先优势和忠实用户群的地方。
Google 需要缩小的编码差距
编码已悄然成为人工智能行业的主要收入驱动力。 Anthropic 和 OpenAI 都建立了庞大的业务,向企业和开发者平台销售具有编码能力的模型,并且到 2026 年,对代理编码性能的第三方评估一直将 Claude 和 GPT 模型置于 Gemini 之前。
这种差距会产生真正的后果。选择编码模型的开发人员倾向于留在其生态系统内——其 CLI 工具、其编辑器集成、其 API 计费。谷歌通过搜索、Android 和 Workspace 获得的巨大分销优势尚未转化为在编码领域的同等主导地位,《华尔街日报》的报告表明 DeepMind 知道现在是改变这种状况的窗口。
Flash 品牌本身也是计算的一部分。自从 Google 开始将 Flash 定位为 Gemini 系列中快速、廉价的一层,该后缀就代表了开发人员在生产中实际运行的模型 - 大容量、价格敏感的工作负载,其中延迟和成本的微小差异决定了 API 选择。在编码方面也处于领先地位的 Flash 层模型将削弱竞争对手的定价论点,同时也符合其质量主张。
Gemini 3.7 Flash 快速跟进
如果周三发布,那么它将是在谷歌于 8 月中旬发布 Gemini 3.7 Flash 几周后发布的,该公司将这一版本定位为最智能的编码和代理主力模型,价格大约是之前价格的一半。谷歌还在 8 月底的发布报道中推出了具有增强编码能力的 Gemini 3.7 Flash。
压缩的节奏并没有被忽视。 NokiaPowerUser 本周报道了“谷歌如何如此快地修复 3.7 Flash”,这反映了一种更广泛的观点,即 DeepMind 已转向快速、增量交付——更接近其竞争对手的每周迭代节奏,而不是前几代 Gemini 的长达一年的差距。
专注于编码并减少幻觉
除了原始编码强度之外,即将推出的模型的覆盖范围还指出了第二个优先事项:减少幻觉。 VOI.ID 报道称,Gemini 3.8 Flash 测试的重点是编码,同时减少人工智能幻觉——这是软件工作中最重要的可靠性问题,一个错误的建议可能会破坏生产系统。
这种组合——更强的代理编码加上更少的伪造输出——正是针对开发人员在解释为什么他们坚持使用 Claude 或基于 GPT 的工具来进行严肃的工程工作时引用的两个轴。
腾讯论文泄露
该模特的名字在《华尔街日报》报道之前就公开露面了,尽管很少。据 Pasquale Pillitteri 报道,腾讯的一篇研究论文中对 Gemini 3.8 Flash 的一行提及,让爱好者第一次明确地确认了该型号的存在,但基本上没有透露任何信息。偶然泄露是业内常见的模式:学术论文中的基准表和引文列表已成为有关未发布模型的发布前情报的反复来源。
这对开发商和市场意味着什么
如果 Gemini 3.8 Flash 如报道所述本周登陆,继 Anthropic 周一推出具有更便宜的代理编码的 Claude Fable 5.1 和 Mythos 5.1 之后,开发人员将在同月内推出顶级编码模型的三个前沿实验室。本来就很紧张的定价压力将会变得更加严峻,而基于这些 API 构建的工具制造商将获得与每个新竞争对手的谈判筹码。
对于谷歌来说,风险不仅仅在于开发者的关注度。如果 Alphabet 自己的模型能够可靠地支持企业首先实现自动化的编码工作流程,那么 Alphabet 的云业务、Workspace 生产力套件以及 Android 生态系统都会受益。一个可信的双子座编码故事支持这三者。
《华尔街日报》的报道表明,谷歌相信它终于缩小了差距。基准测试——更重要的是,工作中的开发人员——是否一致将在几天内明朗。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →
