谷歌拖延已久的 Gemini 3.5 Pro 多次出现在 LMSYS Chatbot Arena 的盲测池中,向开发者社区发出了明确的信号:旗舰型号的公开发布可能终于迫在眉睫。虽然该公司的官方说法仍然是该模型“目前正在合作伙伴测试中”,但一系列社区观察、后端异常和异常强烈的反应都表明在更广泛的推出之前正在进行后期 A/B 测试。
这些目击事件很重要,因为聊天机器人竞技场的出现很少是偶然的。当未宣布的模型出现在平台的盲目偏好之战中时,它通常是公共 API 和网络发布之前的最后压力测试阶段。有关这些发布周期如何塑造市场的更多信息,请关注我们的 AI 模型报道。
开发人员所看到的
根据 NokiaPowerUser 于 2026 年 8 月 2 日报道的社区观察,X 和 Discord 的测试人员描述了他们遇到了一个快速、高能力的模型,该模型将自己标识为 DeepMind 创建的 gemini-3.5-pro 标识符。出现了几种模式:
- 重复盲测出现: 该模型不断出现在 Chatbot Arena 的匿名头对头比较中,这是谷歌通常为即将发布的模型保留的曝光方式。
- 主动 A/B 测试信号: 跨开发人员平台发现了微妙的界面和后端更新,这种模式与发布前的部署阶段一致。
- “Flash”异常: 多个用户记录了标准 Flash 模型的异常响应,这些响应显示出异常深入的推理,表明在实时评估期间影子路由到未发布的更高层模型。
谷歌 DeepMind 坚称合作伙伴验证仍在进行中。但正如 NokiaPowerUser 指出的那样,历史表明,一旦 Arena 分阶段开始,此阶段通常会迅速过渡到全面可用。
已经迟到的模型
在这家搜索巨头经历了几个月的沮丧之后,竞技场的目击事件发生了。在 2026 年 5 月的 Google I/O 开发者大会上,Google 推出了适合日常使用的轻量级 Gemini 3.5 Flash 型号,首席执行官 Sundar Pichai 在会前媒体吹风会上表示,Pro 版本将于 6 月推出。据 Mashable 报道,皮查伊表示:“我们也对 3.5 Pro 感到兴奋。” “我们正在内部使用它。它显示出巨大的改进。”
六月来了又去,没有任何释放。 7 月中旬,彭博社报道称,这一延迟让谷歌工程师、人工智能研究人员和管理人员感到沮丧,他们担心该公司可能会失去对竞争对手 Anthropic 和 OpenAI 的优势。 Mashable 于 7 月 17 日证实了彭博社的报道,并指出谷歌仅提供了关于“在多种型号上快速发货”的模糊声明。
对于谷歌来说,风险不仅仅在于吹牛的权利。早些时候的泄密表明,Gemini 3.5 Pro 在高级推理、编码和长期任务执行等关键领域表现不佳,在一些基准测试中落后于 Anthropic 的 Fable 5 和 OpenAI 的 GPT-5.6 等竞争对手。
为什么编码差距很重要
任何推出的时机都至关重要。虽然 Gemini 3.6 Flash 等最新版本提供了可靠的令牌效率和较低的延迟,但开发人员反馈表明,轻量级模型在复杂的长期软件工程任务中仍然存在不足。开发人员正在寻找一款能够进行企业级重构、自主调试和复杂逻辑执行而不会陷入幻觉循环的旗舰产品。
根据早期的社区互动和 Google 最近的发布模式,Gemini 3.5 Pro 的预期重点领域包括高级代理编码、更深入的工具集成和前沿级推理——这正是轻量级模型未给人留下深刻印象的功能。
竞争压力越来越大
谷歌并不是在真空中运作。激烈的价格竞争和一波强大的开放重量版本(尤其是来自中国开发商的版本)扰乱了更广泛的模型市场。 DeepSeek 和 Moonshot AI 的 Kimi K3 降低了成本并缩小了性能差距,而 Anthropic 和 OpenAI 则继续快速迭代其前沿产品。
在这种环境下,长期拖延带来的风险不仅仅是尴尬。如果没有有竞争力的旗舰产品,开发人员和企业每周都会权衡替代方案——其中一些替代方案现在更便宜,而且在特定任务中速度更快。竞技场的目击事件表明谷歌知道时间正在流逝。
Gemini 3.5 Pro 是否缩小了编码差距并消除了对其推理能力的担忧,只有当它从盲目测试转移到开发人员手中时才会变得清晰。但在错过了一个夏天的最后期限之后,该模型出现在 LMSYS 的测试池中是迄今为止发布已接近尾声的最强烈信号。
保持人工智能领先地位
推出下一代前沿模型的竞赛从未放缓。 AI Buzz Wire 跟踪每次发布、泄漏和基准测试。
探索最新的人工智能发展 →