该版本于 2026 年 7 月 30 日宣布,以视觉-语言-动作 (VLA) 模型为中心,该模型将机器人的所见所闻转换为精确的运动命令。 DeepMind 将其描述为通用机器人的智能层,该公司将此次发布定位为将人工智能带出聊天窗口并进入物理世界的转折点。有关更广泛的行业推动嵌入式人工智能的更多信息,请关注我们的重大人工智能新闻。
三种模型,一种系统
DeepMind 在 Gemini Robotics 2 系列中推出了三个互补模型:
- Gemini Robotics 2 — 旗舰 VLA 模型,可将视觉和语言转化为运动控制,使机器人能够采取物理动作。
- Gemini Robotics ER 2 — 一种具身推理模型,能够理解物理空间并生成与人类和其他机器人协调的详细、多步骤计划。
- Gemini Robotics On-Device 2 — VLA 模型的轻量级版本,经过优化可在机器人硬件上本地运行,减少对云连接的依赖。
根据 DeepMind 博客的说法,每个模型都有一个专门的角色,但这三个模型被设计为作为一个集成系统运行。 VLA 模型处理实时操作,ER 模型处理更高级别的规划,设备上的变体可实现机器人本身的低延迟响应。
从脚到指尖
公告中最引人注目的主张是 DeepMind 所说的智能全身控制。 Gemini Robotics 2 不是训练机器人重复一项动作,而是旨在指挥整个人形身体(从脚到指尖),实现全方位的类人运动,包括弯曲、伸展和平衡。
DeepMind 强调了几个灵活性基准。在演示中,由该模型驱动的机器人可以拧紧灯泡、打结以及执行其他需要精细运动控制的精细动作。该实验室表示,该系统的灵活性达到了新的水平,使机器人能够完成需要真正技巧而不是粗暴重复的任务。
该公司还强调适应性。 DeepMind 表示,Gemini Robotics 2 可以在短短几个小时内适应任何双臂机器人,这意味着相同的底层智能可以从桌面手臂扩展到复杂的人形机器人,而无需完整的再训练周期。这种概括与传统机器人技术有很大不同,在传统机器人技术中,每台机器通常都需要专门构建的软件。
机器人一起工作
另一个主要功能是多机器人协作。 DeepMind 表示,Gemini Robotics 2 支持两个机器人一起完成一项任务的场景,在共享的物理空间中分工。 ER 2 模型负责协调 - 推理环境、规划多步骤序列以及在机器之间分配步骤。
在该公司引用的一次演示中,一对机器人合作清洁一个房间,分担工作,而不是互相碰撞。 DeepMind 将此视为人工智能不仅可以管理个人行为,还可以管理现实世界中多个代理的编排的早期证据。
互动且可指导
除了自主操作之外,这些模型还被设计为交互式的。 Gemini Robotics 2 可以在执行动作时解释其方法,用户可以使用日常语言而不是技术命令来重定向机器人的中间任务。 DeepMind 表示,这使得该平台非常适合在不稳定或危险的环境中指导机器人,在这些环境中,人类操作员需要即时调整计划。
为什么它很重要
此次发布加剧了本已拥挤的人形机器人竞赛。图、波士顿动力和特斯拉等公司一直在竞相将行走机器、工作机器商业化,而英伟达等芯片制造商则在物理人工智能所需的模拟和计算基础设施上投入了大量资金。
DeepMind 的赌注是,单一的通用智能层(以聊天机器人推理文本的方式推理物理世界的智能层)可以取代几十年来定义工业机器人的定制、狭隘软件。如果该系统确实可以在数小时内适应任何实施例,那么它将降低制造商和研究人员部署功能强大的机器人的障碍,而无需每次都从头开始。
该公司表示,正在与值得信赖的硬件合作伙伴合作扩展该平台,并在发布的同时发布了责任和安全文档。关于这些模型在受控演示之外的表现以及全身人形控制如何快速转化为可靠的现实世界部署,仍然存在疑问。
尽管如此,此次发布的广度——全身运动、多步推理、设备端效率和单一产品系列中的多代理协调——表明谷歌打算成为大型人工智能模型和物理机器融合的主要参与者。
保持人工智能领先地位
机器人技术前沿正在快速发展,AI Buzz Wire 正在跟踪每一项重大发展。 阅读更多人工智能新闻,持续报道模型发布、硬件突破和行业转变。
探索最新的人工智能发展 →