Google DeepMind đã ra mắt Gemini Robotics 2, một dòng mô hình AI vật lý mà phòng thí nghiệm cho biết có thể điều khiển thông minh mọi loại robot — từ máy trạm hai cánh tay đến cơ thể hình người hoàn toàn — đánh dấu nỗ lực đầy tham vọng nhất của công ty trong thế giới máy móc chuyển động.

Được công bố vào ngày 30 tháng 7 năm 2026, bản phát hành tập trung vào mô hình thị giác-ngôn ngữ-hành động (VLA) chuyển đổi những gì robot nhìn thấy và nghe thấy thành các lệnh vận động chính xác. DeepMind mô tả nó là lớp thông minh dành cho robot có mục đích chung và công ty coi việc ra mắt là một bước ngoặt trong việc đưa AI ra khỏi cửa sổ trò chuyện và vào thế giới vật lý. Để biết thêm thông tin về nỗ lực rộng lớn hơn của ngành hướng tới AI hiện thân, hãy theo dõi tin tức AI mới nhất của chúng tôi.

Ba mô hình, một hệ thống

DeepMind đã xuất xưởng ba mô hình bổ sung trong dòng Gemini Robotics 2:

  • Gemini Robotics 2 — mô hình VLA hàng đầu giúp chuyển tầm nhìn và ngôn ngữ thành điều khiển động cơ, cho phép robot thực hiện hành động vật lý.
  • Gemini Robotics ER 2 — một mô hình suy luận được thể hiện có khả năng hiểu không gian vật lý và tạo ra các kế hoạch chi tiết, gồm nhiều bước phối hợp với con người và các robot khác.
  • Gemini Robotics On-Device 2 — phiên bản nhẹ của mô hình VLA được tối ưu hóa để chạy cục bộ trên phần cứng robot, giảm sự phụ thuộc vào kết nối đám mây.

Theo blog DeepMind, mỗi mô hình có vai trò chuyên môn nhưng bộ ba được thiết kế để hoạt động như một hệ thống tích hợp duy nhất. Mô hình VLA xử lý hành động theo thời gian thực, mô hình ER xử lý việc lập kế hoạch ở cấp độ cao hơn và biến thể trên thiết bị cho phép phản hồi có độ trễ thấp trên chính robot.

Từ bàn chân đến đầu ngón tay

Tuyên bố nổi bật nhất trong thông báo là cái mà DeepMind gọi là khả năng kiểm soát toàn bộ cơ thể thông minh. Thay vì huấn luyện robot lặp lại một chuyển động, Gemini Robotics 2 được thiết kế để điều khiển toàn bộ cơ thể hình người - từ bàn chân đến đầu ngón tay - cho phép thực hiện đầy đủ các chuyển động giống con người bao gồm uốn cong, vươn tới và giữ thăng bằng.

DeepMind nêu bật một số tiêu chuẩn về sự khéo léo. Trong các cuộc trình diễn, các robot được hỗ trợ bởi mô hình đã được thể hiện bằng cách vặn vít vào bóng đèn, thắt nút và thực hiện các hành động tinh vi khác đòi hỏi phải điều khiển động cơ tinh tế. Phòng thí nghiệm cho biết hệ thống này đạt được mức độ khéo léo mới cho phép robot hoàn thành các nhiệm vụ đòi hỏi sự khéo léo thực sự thay vì lặp đi lặp lại một cách thô bạo.

Công ty cũng nhấn mạnh đến khả năng thích ứng. DeepMind cho biết, Gemini Robotics 2 có thể được điều chỉnh cho phù hợp với bất kỳ robot hai tay nào chỉ trong vài giờ, điều đó có nghĩa là trí thông minh cơ bản tương tự có thể mở rộng từ cánh tay để bàn đến robot hình người phức tạp mà không cần chu trình đào tạo lại đầy đủ. Sự khái quát hóa này là một sự khác biệt đáng kể so với chế tạo robot thông thường, trong đó mỗi máy thường yêu cầu phần mềm được xây dựng theo mục đích cụ thể.

Robot làm việc cùng nhau

Một khả năng nổi bật khác là sự cộng tác của nhiều robot. DeepMind cho biết Gemini Robotics 2 hỗ trợ các tình huống trong đó hai robot làm việc cùng nhau trong một nhiệm vụ duy nhất, phân công lao động trong một không gian vật lý chung. Mô hình ER 2 xử lý việc phối hợp - suy luận về môi trường, vạch ra trình tự gồm nhiều bước và phân bổ các bước giữa các máy.

Trong một ví dụ được công ty trích dẫn, một cặp robot đã hợp tác để dọn phòng, phân chia công việc thay vì va vào nhau. DeepMind coi đây là bằng chứng ban đầu cho thấy AI có thể quản lý không chỉ các hành động riêng lẻ mà còn quản lý sự phối hợp của nhiều tác nhân trong thế giới thực.

Tương tác và có thể hướng dẫn

Ngoài khả năng vận hành tự động, các mô hình còn được thiết kế để có tính tương tác. Gemini Robotics 2 có thể giải thích cách tiếp cận của nó trong khi thực hiện một hành động và người dùng có thể chuyển hướng robot đang thực hiện nhiệm vụ bằng cách sử dụng ngôn ngữ hàng ngày thay vì các lệnh kỹ thuật. DeepMind cho biết điều này làm cho nền tảng này rất phù hợp để hướng dẫn robot trong môi trường dễ bay hơi hoặc nguy hiểm, nơi người vận hành cần điều chỉnh kế hoạch một cách nhanh chóng.

Tại sao nó lại quan trọng

Sự ra mắt này làm tăng thêm cuộc chạy đua robot hình người vốn đã đông đúc. Các công ty bao gồm Fig, Boston Dynamics và Tesla đang chạy đua để thương mại hóa máy đi bộ và máy làm việc, trong khi các nhà sản xuất chip như Nvidia đã đầu tư rất nhiều vào cơ sở hạ tầng mô phỏng và tính toán mà AI vật lý yêu cầu.

DeepMind đặt cược rằng một lớp thông minh có mục đích chung, duy nhất - một lớp lý luận về thế giới vật chất giống như cách chatbot suy luận về văn bản - có thể thay thế phần mềm hẹp, riêng biệt đã định nghĩa robot công nghiệp trong nhiều thập kỷ. Nếu hệ thống thực sự có thể thích ứng với bất kỳ phương án nào trong vài giờ, nó sẽ hạ thấp rào cản đối với các nhà sản xuất và nhà nghiên cứu đang tìm cách triển khai các robot có khả năng mà không phải bắt đầu lại từ đầu mỗi lần.

Công ty cho biết họ đang làm việc với các đối tác phần cứng đáng tin cậy để mở rộng nền tảng và công bố tài liệu về trách nhiệm và an toàn cùng với việc phát hành. Vẫn còn các câu hỏi về cách các mô hình này hoạt động bên ngoài các cuộc biểu tình có kiểm soát và việc điều khiển hình người toàn thân có thể chuyển thành việc triển khai trong thế giới thực một cách đáng tin cậy như thế nào.

Tuy nhiên, phạm vi của đợt ra mắt – chuyển động toàn thân, lý luận nhiều bước, hiệu quả trên thiết bị và phối hợp nhiều tác nhân trong một dòng sản phẩm duy nhất – báo hiệu rằng Google dự định trở thành người chơi chính trong sự hội tụ của các mô hình AI lớn và máy móc vật lý.

Đi trước AI

Biên giới robot đang phát triển nhanh chóng và AI Buzz Wire đang theo dõi mọi sự phát triển chính. Đọc thêm tin tức về AI để biết thông tin liên tục về các phiên bản mô hình, những đột phá về phần cứng và những thay đổi trong ngành.

Khám phá những phát triển AI mới nhất →