Google DeepMind는 양팔 워크스테이션부터 완전한 인간형 신체에 이르기까지 모든 유형의 로봇을 지능적으로 제어할 수 있는 물리적 AI 모델 제품군인 Gemini Robotics 2를 출시했습니다. 이는 움직이는 기계 세계에 대한 회사의 가장 야심 찬 추진을 의미합니다.

2026년 7월 30일에 발표된 이 릴리스는 로봇이 보고 듣는 것을 정확한 모터 명령으로 변환하는 VLA(비전-언어-행동) 모델을 중심으로 합니다. DeepMind는 이를 범용 로봇 공학의 인텔리전스 계층으로 설명하며 회사는 이번 출시를 AI를 채팅 창에서 실제 세계로 가져오는 전환점으로 삼았습니다. 구현된 AI를 향한 업계의 폭넓은 추진에 대해 자세히 알아보려면 AI 속보를 팔로우하세요.

세 가지 모델, 하나의 시스템

DeepMind는 Gemini Robotics 2 라인업에 세 가지 보완 모델을 출시했습니다.

  • Gemini Robotics 2 — 시각과 언어를 모터 제어로 변환하여 로봇이 물리적 행동을 취할 수 있도록 하는 주력 VLA 모델입니다.
  • Gemini Robotics ER 2 — 물리적 공간을 이해하고 인간 및 다른 로봇과 조화를 이루는 상세한 다단계 계획을 생성할 수 있는 구체화된 추론 모델입니다.
  • Gemini Robotics On-Device 2 — 로봇 하드웨어에서 로컬로 실행되도록 최적화된 VLA 모델의 경량 버전으로, 클라우드 연결에 대한 의존도를 줄입니다.

DeepMind 블로그에 따르면 각 모델에는 전문가 역할이 있지만 세 모델은 단일 통합 시스템으로 작동하도록 설계되었습니다. VLA 모델은 실시간 작업을 처리하고, ER 모델은 더 높은 수준의 계획을 처리하며, 온디바이스 변형은 로봇 자체에서 짧은 대기 시간 응답을 가능하게 합니다.

발에서 손끝까지

발표에서 가장 눈에 띄는 주장은 DeepMind가 지능형 전신 제어라고 부르는 것입니다. Gemini Robotics 2는 로봇이 한 동작을 반복하도록 훈련시키는 대신 발부터 손가락 끝까지 인간형 신체 전체를 명령하도록 설계되어 굽힘, 손 뻗기, 균형 잡기 등 인간과 유사한 모든 범위의 움직임을 가능하게 합니다.

DeepMind는 여러 민첩성 벤치마크를 강조했습니다. 시연에서 모델로 구동되는 로봇은 전구를 조이고, 매듭을 묶고, 미세한 모터 제어가 필요한 기타 섬세한 작업을 수행하는 모습을 보여주었습니다. 연구소는 이 시스템이 로봇이 무차별적인 반복보다는 진정한 기교를 요구하는 작업을 완료할 수 있도록 하는 새로운 수준의 민첩성을 달성했다고 말했습니다.

회사는 적응력도 강조했다. Gemini Robotics 2는 단 몇 시간 만에 모든 양팔 로봇에 적용할 수 있으며, 이는 동일한 기본 지능이 전체 재교육 주기 없이 테이블 위 팔에서 복잡한 휴머노이드까지 확장될 수 있음을 의미한다고 DeepMind는 말했습니다. 이러한 일반화는 각 기계에 일반적으로 특수 목적 소프트웨어가 필요한 기존 로봇 공학과는 크게 다릅니다.

함께 일하는 로봇

또 다른 헤드라인 기능은 다중 로봇 협업입니다. DeepMind는 Gemini Robotics 2가 두 대의 로봇이 단일 작업을 위해 함께 작업하여 공유된 물리적 공간에서 노동을 나누는 시나리오를 지원한다고 말했습니다. ER 2 모델은 환경에 대한 추론, 다단계 시퀀스 매핑, 기계 간 단계 할당 등 조정을 처리합니다.

회사가 인용한 한 시연에서는 한 쌍의 로봇이 서로 부딪히지 않고 작업을 분할하여 방을 청소하기 위해 협력했습니다. DeepMind는 이를 AI가 개별 행동뿐만 아니라 실제 세계에서 여러 에이전트의 조정을 관리할 수 있다는 초기 증거로 구성했습니다.

대화형 및 교육 가능

자율 작동 외에도 모델은 대화형으로 설계되었습니다. Gemini Robotics 2는 작업을 수행하는 동안 접근 방식을 설명할 수 있으며, 사용자는 기술적인 명령이 아닌 일상적인 언어를 사용하여 작업 중간에 로봇의 방향을 바꿀 수 있습니다. DeepMind는 이 플랫폼이 인간 운영자가 즉석에서 계획을 조정해야 하는 불안정하거나 위험한 환경에서 로봇을 지시하는 데 매우 적합하다고 말했습니다.

중요한 이유

이번 출시로 인해 이미 혼잡한 휴머노이드-로봇 경쟁이 더욱 심화되었습니다. Figure, Boston Dynamics, Tesla 등의 회사는 걷고 일하는 기계를 상용화하기 위해 경쟁해 왔으며 Nvidia와 같은 칩 제조업체는 물리적 AI에 필요한 시뮬레이션 및 컴퓨팅 인프라에 막대한 투자를 했습니다.

DeepMind는 단일 범용 인텔리전스 계층(챗봇이 텍스트에 대해 추론하는 방식으로 물리적 세계에 대해 추론하는 계층)이 수십 년 동안 산업용 로봇을 정의해 온 좁은 맞춤형 소프트웨어를 대체할 수 있다고 확신합니다. 시스템이 실제로 몇 시간 안에 모든 구현에 적응할 수 있다면 매번 처음부터 시작하지 않고도 유능한 로봇을 배포하려는 제조업체와 연구원의 장벽이 낮아질 것입니다.

회사는 플랫폼을 확장하기 위해 신뢰할 수 있는 하드웨어 파트너와 협력하고 있으며 릴리스와 함께 책임 및 안전 문서를 게시했다고 밝혔습니다. 이러한 모델이 통제된 시연 밖에서 어떻게 작동하는지, 그리고 전신 휴머노이드 제어가 얼마나 신속하게 신뢰할 수 있는 실제 배포로 전환될 수 있는지에 대한 의문이 남아 있습니다.

그럼에도 불구하고 단일 제품군의 전신 움직임, 다단계 추론, 기기 내 효율성 및 다중 에이전트 조정 등 출시의 폭은 Google이 대규모 AI 모델과 물리적 기계의 융합에서 주요 플레이어가 되려는 의도를 나타냅니다.

AI보다 앞서 나가세요

로봇 공학 분야는 빠르게 움직이고 있으며 AI Buzz Wire는 모든 주요 개발을 추적하고 있습니다. 더 많은 AI 뉴스를 읽어보세요에서 모델 출시, 하드웨어 혁신, 업계 변화에 대한 지속적인 보도를 확인하세요.

최신 AI 개발 살펴보기 →