Google DeepMind 已将计算机的使用转变为 Gemini 3.5 Flash 内的内置工具,为开发人员提供了一种构建 AI 代理的本机方法,该代理可以跨平台与软件交互,而无需依赖第三方框架。
该公告于 2026 年 6 月 24 日发布在 Google 官方关键字博客上,将 Gemini 3.5 Flash 定位为快速发展的代理市场中的竞争者,这些代理可以查看屏幕、移动光标、单击和打字,而这些功能直到最近还需要大量的定制工程。 更多相关背景,请参阅我们的人工智能资讯。
该公司写道:“计算机使用现在是 Gemini 3.5 Flash 中的内置工具,用于构建可以跨平台交互的代理。”这篇文章的作者是 Google DeepMind 产品经理 Mateo Quiros。
它是如何工作的
计算机的使用允许模型像人类一样操作计算机:通过解释屏幕上的内容并采取单击、滚动和输入文本等操作。通过将该功能直接融入到 Gemini 3.5 Flash 中,而不是将其作为单独的产品提供,Google 正在为想要构建能够导航真实应用程序、网站和操作系统的代理的开发人员降低障碍。
根据博客文章,开发人员和企业可以通过 Gemini API 和 Gemini Enterprise Agent Platform(Google 用于大规模构建和部署代理的专用环境)开始在 3.5 Flash 中使用计算机。
谷歌通过具体用例展示了该功能。在一个示例中,Gemini 3.5 Flash 使用计算机来分析 Gemini 应用程序本身并返回分类的功能列表。在另一个例子中,该模型审核了自己的文档以了解可访问性问题——这是一项自我参考任务,暗示有一天使用计算机的代理可能会如何帮助维护它们运行的软件生态系统。
安全:对抗性训练和“纵深防御”方法
此次发布中最重要的部分可能是谷歌关于安全的言论。在实时环境中运行的代理特别容易受到提示注入攻击,即嵌入网页、电子邮件或文档中的隐藏指令劫持代理以采取意外操作的攻击。
谷歌表示,它在 Gemini 3.5 Flash 中对计算机使用进行了有针对性的对抗性训练,以减轻这些风险。它还发布了两个可选的企业保障系统,该公司表示,这些系统使组织能够更好地控制其代理的行为。
采用“纵深防御”方法,谷歌鼓励开发人员将这些功能与安全沙箱、人机交互验证和严格的访问控制相结合。该公司在其最佳实践文档中发布了该功能的附加指南。
这个框架很重要。计算机的使用被广泛视为部署的更危险的代理功能之一,因为受感染的代理可以在用户的帐户和系统内执行真实世界的操作。通过以对抗性训练和分层保护措施为主导,谷歌正试图安抚那些一直犹豫是否将光标控制权交给人工智能的企业买家。
为什么计算机的使用正在成为战场
Gemini 3.5 Flash 的计算机应用到来之际,各大人工智能实验室都在竞相制造能够做有用工作而不仅仅是回答问题的代理。 Anthropic 于 2024 年底为 Claude 推出了一款计算机使用工具,OpenAI 的算子和代理产品也朝着同一方向推进。使该功能原生于 Flash 等快速、经济高效的模型中,而不是将其保留在高级层中,这表明谷歌希望快速将代理控制商品化。
Flash 的选择本身就值得注意。 Flash 是 Google 的效率层模型,针对速度和成本进行了优化。在那里嵌入计算机使用,而不仅仅是在更大的 Pro 模型中,表明谷歌预计会有大容量、对延迟敏感的代理工作负载——这种工作负载可以大规模自动化跨业务软件的重复任务。
谷歌表示,它已经看到客户通过使用计算机来创造价值,尽管该博客文章没有提及具体的商业部署或量化结果。
竞争风险
对于开发人员来说,内置计算机使用工具的吸引力很简单:需要维护的集成更少,并且单个供应商负责模型和代理层。但这也加深了对谷歌平台的依赖,企业将在与模型无关的代理框架的灵活性之间进行权衡。
此次发布还加剧了代理经济中更广泛的紧张局势。独立开发的开源代理网关,例如使多个LLM提供商OpenAI兼容的Lightport框架,显示了对便携式代理基础设施的需求有多大。谷歌的赌注是,第一方、安全强化的计算机使用工具将赢得那些原本将第三方工具拼凑在一起的开发人员的青睐。随着模型获得在屏幕上操作的能力,人工智能助手和自主操作员之间的界限变得越来越模糊——生产力突破和安全责任之间的界限也变得越来越模糊。谷歌对这种紧张局势的回应是分层保障措施和对抗性训练。这是否足以满足规避风险的企业将决定使用计算机的代理从演示转向日常使用的速度。
通过 Gemini 3.5 Flash,谷歌做出了明确的赌注:人工智能的未来不仅仅是回答的模型,而是行动的模型 - 并且它希望开发人员在其平台上构建这些行动模型。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →


