Google 发布了 Gemini 3.7 Flash,将该模型描述为迄今为止编码和代理工作流程中最智能的主力。此次发布仅在 Gemini 3.6 Flash 发布三周后发布,并在软件工程、知识工作和 Web 开发方面带来了重大改进。如需了解更多 AI 重大新闻和行业分析,请访问 AI Buzz Wire。
Gemini 3.7 Flash 的新增功能
根据谷歌官方公告,3.7 Flash 的发布是开发者反馈和该公司计划为未来模型带来的新算法创新的直接结果。该模型在编码任务(包括调试和问题解决)方面比其前身表现出强大的优势,具有更高的首次通过代码准确性和生成生产就绪代码的性能提高。
在 FrontierCode 1.1 Main 基准测试中,3.7 Flash 得分为 43.6%,高于 3.6 Flash 的 34.4%。在评估现实世界软件工程任务的 DeepSWE v1.1 上,该模型从 49.0% 跃升至 65.3%。
Web 开发和知识工作
对于网络开发,谷歌表示 3.7 Flash 可以在更少的提示下生成更多功能布局和功能完整的应用程序。当将 UI 输出与参考输入(例如屏幕截图、图像或完整设计系统)进行匹配时,该模型表现出高度的设计一致性。在 Arena.ai 的 WebDev Arena 上,3.7 Flash 的 Elo 得分为 1588,而之前版本的 Elo 得分为 1538。
在金融、法律和生物科学等知识密集领域,该模型可以提高推理能力和准确性。在测试模型处理复杂文档能力的 GDP.pdf 基准测试中,3.7 Flash 的得分为 34.0%,而 3.6 Flash 的得分为 22.0%。在衡量实际业务工作流程完成情况的 AutomationBench 上,它从 17.0% 提高到 30.4%。
定价策略:成本减半
该版本最引人注目的方面之一是其定价。 Gemini 3.7 Flash 的首发价格为每百万个输入代币 0.75 美元,每百万个输出代币 3.75 美元,恰好是 3.6 Flash 原始成本的一半。该定价有效期至 2026 年底,此后,自 2027 年 1 月 1 日起,将适用每百万个输入代币 1.50 美元和每百万个输出代币 7.50 美元的标准费率。
Google 将此定位为使开发人员和客户能够经济高效地扩展生产就绪代理,将增强的性能与低成本相结合。
改进的开发者体验
除了原始基准之外,谷歌还强调了开发人员体验方面的有意义的改进。该模型可以更好地适应障碍,在需要时澄清意图,并以更高的保真度遵循指令。它更勤奋地思考,在多步骤规划和工具调用上投入更多精力,从而实现更有纪律的执行,减少人工监督,并减少工程工作流程中的重试。
Gemini Spark 升级
Gemini Spark 是 Google 的个人 AI 代理,可供 160 多个国家/地区的 Google AI Pro 和 Ultra 订阅者使用,现在在 Gemini 3.7 Flash 上运行。 Google 将 Spark 描述为 24/7 代理,在其指导下代表用户采取行动。此次模型更新使 Spark 能够更高效地进行知识工作,改进了 Google Workspace 应用程序的工具使用,并提高了复杂的多技能工作流程的准确性。
安全和保障措施
Gemini 3.7 Flash 附带更新的防护措施,防止化学、生物、放射和核 (CBRN) 威胁和网络犯罪相关领域的滥用,同时仍然支持有益的用例。谷歌表示,这些保护措施与其生物弹性方法和网络计划相一致。
更广泛的竞争格局
此次发布正值人工智能开发市场争夺战愈演愈烈之际。谷歌强调将前沿水平的编码和代理性能与激进的定价相结合,这给 Anthropic、OpenAI 和 xAI 等竞争对手带来了压力。随着 DeepSeek 刚刚发布了 V4 Pro 模型,xAI 发布了 Grok 4.6,Google 明确将 3.7 Flash 定位为模型开发人员在需要强大的编码和代理性能而不超出预算时应该使用的模型。
3.6 Flash 和 3.7 Flash 之间每三周的快速更新也表明 Google 致力于对其中端产品线进行迭代、高速模型改进。
保持人工智能领先地位
如需了解最新的 AI 发展、模型发布和行业分析,请添加书签 AI Buzz Wire。
阅读更多人工智能新闻 →