Google DeepMind 已将 Interactions API 作为其 Gemini 模型和代理的默认接口,完成了对旧版“generateContent”接口的转变,该接口自模型首次发布以来就一直是 Gemini 开发的基础。谷歌于 6 月 26 日在开发者博客上宣布的这一举措,将自 2025 年 12 月以来一直处于测试阶段的 API 提升为开发者在 Gemini 上构建的主要方式。
谷歌强调,旧的“generateContent”界面仍然有效,因此现有应用程序不会在一夜之间崩溃。但该公司现在划定了一条坚定的界限:新的代理功能今后将仅通过 Interactions API 提供。 更多相关背景,请参阅我们的人工智能资讯。
> “互动为特工的新时代奠定了基础。”
>
> — Logan Kilpatrick,Google 开发者关系主管
谷歌发布了迁移指南,帮助开发人员从以前的界面迁移,新的 API 现在是 Google AI Studio 和所有 Gemini 官方文档中的默认 API。
交互 API 有何变化
最显着的变化是结构性的。以前的界面围绕角色组织对话——“用户”和“模型”等标签——反映了大多数大型语言模型 API 采用的熟悉的聊天格式。交互 API 用类型化步骤取代了基于角色的结构,其中每个操作(从用户输入到函数调用再到模型响应)都是其自己显式定义的步骤。
据谷歌称,其结果是一种更适合复杂的代理工作流程而不是简单的来回聊天的模式。代理通常需要将工具调用链接在一起,在后台运行,并根据中间结果进行分支——旧的基于角色的对话模型处理起来很笨拙。
内置代理原语
自 2025 年底进入测试版以来,Interactions API 已经积累了一组 Google 定位为一流代理构建块的功能:
- 托管代理在自己的 Linux 沙箱内运行,为开发人员提供了一个用于执行代理生成的代码和命令的隔离环境。
- 后台执行用于长时间运行的任务,允许代理继续异步工作,而不是阻塞单个请求。
- 工具链内置谷歌搜索和谷歌地图,因此代理可以提取实时信息和位置数据,而无需开发人员手动连接这些集成。
- 媒体生成涵盖图像、音乐和语音,让单个代理界面产生多模式输出。
自测试版以来,谷歌还简化了部分架构,消除了早期采用者所标记的摩擦。
弹性和优先模式
基于交互 API 构建的开发人员可以在两种执行模式之间进行选择。 Flex 模式可将成本降低约 50%,用一些延迟换取更便宜的推理 — 对于大容量或后台工作非常有用。 优先级模式 相反,优化速度,路由请求以获得最快的响应。
成本杠杆对于谷歌的竞争至关重要。企业人工智能支出已成为整个行业的核心关注点,随着模型使用规模的扩大,企业越来越多地审查代币成本。提供 50% 的成本降低模式,为 Gemini 开发者提供了一种无需离开平台即可控制账单的具体方法。
为什么转变很重要
这一转变反映了更广泛的行业从“聊天”界面转向“代理”界面的转变。早期的法学硕士产品被定位为对话助理,而当前的开发者工具浪潮是围绕自主和半自主代理构建的,这些代理可以跨工具和服务完成多步骤任务。
通过将交互 API 设置为默认值,并为其专门保留新的代理功能,谷歌正在将其整个开发者群体推向为代理未来设计的基础设施。继续使用“generateContent”的开发人员将保留兼容性,但会逐渐错过新功能。
随着代理层竞争的加剧,这一变化也随之而来。 Anthropic 凭借其 Claude Code 和 Claude Tag 产品向代理基础设施倾斜,OpenAI 继续扩展其代理和计算机使用功能,开源框架也在成倍增加。谷歌的赌注是,随着代理应用程序投入生产,拥有开发人员界面(而不仅仅是底层模型)将具有决定性作用。
谷歌尚未宣布“generateContent”接口的终止日期,但明确的方向是交互 API 现在是任何在 Gemini 上构建的人的前进道路。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →



