Google DeepMind ได้เปิดตัว Gemini Robotics 2 ซึ่งเป็นตระกูลโมเดล AI ทางกายภาพที่ห้องปฏิบัติการกล่าวว่าสามารถควบคุมหุ่นยนต์ทุกประเภทได้อย่างชาญฉลาด ตั้งแต่เวิร์กสเตชันแบบแขนคู่ไปจนถึงร่างมนุษย์เต็มรูปแบบ ถือเป็นการผลักดันที่ทะเยอทะยานที่สุดของบริษัทเข้าสู่โลกของเครื่องจักรที่กำลังเคลื่อนที่

ประกาศเมื่อวันที่ 30 กรกฎาคม 2026 การเปิดตัวมุ่งเน้นไปที่โมเดลการมองเห็นภาษาการกระทำ (VLA) ซึ่งจะแปลงสิ่งที่หุ่นยนต์มองเห็นและได้ยินเป็นคำสั่งมอเตอร์ที่แม่นยำ DeepMind อธิบายว่ามันเป็นชั้นอัจฉริยะสำหรับหุ่นยนต์เอนกประสงค์ และบริษัทได้วางตำแหน่งการเปิดตัวเป็นจุดเปลี่ยนในการนำ AI ออกจากหน้าต่างแชทและเข้าสู่โลกทางกายภาพ หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับการผลักดันอุตสาหกรรมในวงกว้างไปสู่ ​​AI ที่เป็นรูปเป็นร่าง โปรดติดตาม ข่าวด่วน AI ของเรา

สามรุ่น หนึ่งระบบ

DeepMind จัดส่งโมเดลเสริมสามรุ่นในกลุ่มผลิตภัณฑ์ Gemini Robotics 2:

  • Gemini Robotics 2 — โมเดล VLA เรือธงที่แปลการมองเห็นและภาษาเป็นการควบคุมมอเตอร์ ซึ่งช่วยให้หุ่นยนต์สามารถเคลื่อนไหวร่างกายได้
  • Gemini Robotics ER 2 — โมเดลที่ให้เหตุผลเป็นตัวเป็นตนที่สามารถทำความเข้าใจพื้นที่ทางกายภาพและสร้างแผนงานหลายขั้นตอนโดยละเอียดที่ประสานงานกับมนุษย์และหุ่นยนต์อื่นๆ
  • Gemini Robotics บนอุปกรณ์ 2 — รุ่น VLA เวอร์ชันน้ำหนักเบาที่ได้รับการปรับแต่งให้ทำงานบนฮาร์ดแวร์หุ่นยนต์ในเครื่อง ซึ่งช่วยลดการพึ่งพาการเชื่อมต่อระบบคลาวด์

ตามบล็อกของ DeepMind แต่ละรุ่นมีบทบาทเป็นผู้เชี่ยวชาญ แต่ทั้งสามรุ่นได้รับการออกแบบมาให้ทำงานเป็นระบบบูรณาการเดียว โมเดล VLA จัดการการดำเนินการแบบเรียลไทม์ โมเดล ER จัดการการวางแผนในระดับที่สูงขึ้น และตัวแปรบนอุปกรณ์ช่วยให้หุ่นยนต์ตอบสนองเวลาแฝงต่ำได้

จากเท้าถึงปลายนิ้ว

คำกล่าวอ้างที่โดดเด่นที่สุดในการประกาศคือสิ่งที่ DeepMind เรียกว่าการควบคุมทั้งร่างกายอย่างชาญฉลาด แทนที่จะฝึกหุ่นยนต์ให้ทำซ้ำการเคลื่อนไหว Gemini Robotics 2 ได้รับการออกแบบมาเพื่อควบคุมร่างกายของมนุษย์ทั้งหมด ตั้งแต่เท้าไปจนถึงปลายนิ้ว ช่วยให้สามารถเคลื่อนไหวได้เต็มรูปแบบเหมือนมนุษย์ รวมถึงการงอ เอื้อมมือ และทรงตัว

DeepMind เน้นย้ำเกณฑ์มาตรฐานด้านความคล่องตัวหลายประการ ในการสาธิต หุ่นยนต์ที่ขับเคลื่อนโดยโมเดลดังกล่าวจะถูกแสดงการขันหลอดไฟ ผูกปม และดำเนินการละเอียดอ่อนอื่นๆ ที่ต้องมีการควบคุมมอเตอร์อย่างละเอียด ห้องปฏิบัติการกล่าวว่าระบบนี้ได้รับความคล่องแคล่วในระดับใหม่ ซึ่งช่วยให้หุ่นยนต์สามารถทำงานที่ต้องใช้ความประณีตอย่างแท้จริง แทนที่จะทำซ้ำอย่างดุเดือด

บริษัทยังเน้นย้ำถึงความสามารถในการปรับตัว Gemini Robotics 2 สามารถปรับให้เข้ากับหุ่นยนต์สองแขนได้ภายในเวลาเพียงไม่กี่ชั่วโมง DeepMind กล่าว ซึ่งหมายความว่าหน่วยสืบราชการลับเดียวกันนี้สามารถขยายขนาดจากแขนบนโต๊ะไปเป็นหุ่นยนต์ฮิวแมนนอยด์ที่ซับซ้อนได้โดยไม่ต้องมีการฝึกอบรมซ้ำทั้งหมด ลักษณะทั่วไปนี้แตกต่างไปจากวิทยาการหุ่นยนต์ทั่วไปอย่างมาก โดยที่เครื่องจักรแต่ละเครื่องมักจะต้องใช้ซอฟต์แวร์ที่สร้างขึ้นตามวัตถุประสงค์เฉพาะ

หุ่นยนต์ทำงานร่วมกัน

ความสามารถพาดหัวอีกประการหนึ่งคือการทำงานร่วมกันหลายหุ่นยนต์ DeepMind กล่าวว่า Gemini Robotics 2 รองรับสถานการณ์ที่หุ่นยนต์สองตัวทำงานร่วมกันในงานเดียว โดยแบ่งงานในพื้นที่ทางกายภาพที่ใช้ร่วมกัน แบบจำลอง ER 2 จัดการการประสานงาน — การให้เหตุผลเกี่ยวกับสภาพแวดล้อม การจัดทำแผนผังลำดับหลายขั้นตอน และการจัดสรรขั้นตอนระหว่างเครื่องจักร

ในการสาธิตครั้งหนึ่งที่บริษัทอ้างถึง หุ่นยนต์คู่หนึ่งร่วมมือกันทำความสะอาดห้อง โดยแบ่งงานแทนที่จะชนกัน DeepMind มองว่าสิ่งนี้เป็นหลักฐานในช่วงแรกๆ ที่ว่า AI สามารถจัดการได้ไม่เพียงแค่การกระทำของแต่ละบุคคลเท่านั้น แต่ยังรวมถึงการจัดการตัวแทนหลายรายในโลกแห่งความเป็นจริงด้วย

โต้ตอบและสอนได้

นอกเหนือจากการทำงานแบบอัตโนมัติแล้ว โมเดลต่างๆ ยังได้รับการออกแบบมาให้สามารถโต้ตอบได้ Gemini Robotics 2 สามารถอธิบายแนวทางในขณะที่ดำเนินการ และผู้ใช้สามารถเปลี่ยนเส้นทางหุ่นยนต์ระหว่างทำงานโดยใช้ภาษาในชีวิตประจำวัน แทนที่จะใช้คำสั่งทางเทคนิค DeepMind กล่าวว่าสิ่งนี้ทำให้แพลตฟอร์มนี้เหมาะอย่างยิ่งสำหรับการสอนหุ่นยนต์ในสภาพแวดล้อมที่มีความผันผวนหรือเป็นอันตราย ซึ่งผู้ปฏิบัติงานที่เป็นมนุษย์จำเป็นต้องปรับแผนได้ทันที

ทำไมมันถึงสำคัญ

การเปิดตัวครั้งนี้ทำให้การแข่งขันหุ่นยนต์ฮิวแมนนอยด์มีผู้เข้าร่วมหนาแน่นมากขึ้น บริษัทต่างๆ เช่น Figure, Boston Dynamics และ Tesla ต่างแข่งขันกันเพื่อจำหน่ายเครื่องจักรสำหรับเดินและใช้งาน ในขณะที่ผู้ผลิตชิป เช่น Nvidia ได้ลงทุนมหาศาลในโครงสร้างพื้นฐานด้านการจำลองและการคำนวณที่ AI ทางกายภาพต้องการ

การเดิมพันของ DeepMind ก็คือเลเยอร์อัจฉริยะสำหรับใช้งานทั่วไปเพียงชั้นเดียว — ซึ่งเป็นชั้นที่ให้เหตุผลเกี่ยวกับโลกทางกายภาพเช่นเดียวกับที่แชทบอทให้เหตุผลเกี่ยวกับข้อความ — สามารถแทนที่ซอฟต์แวร์แคบๆ ที่ออกแบบตามความต้องการซึ่งกำหนดนิยามของหุ่นยนต์อุตสาหกรรมมานานหลายทศวรรษ หากระบบสามารถปรับให้เข้ากับรูปลักษณ์ใดๆ ได้ภายในไม่กี่ชั่วโมง มันจะลดอุปสรรคสำหรับผู้ผลิตและนักวิจัยที่ต้องการปรับใช้หุ่นยนต์ที่มีความสามารถโดยไม่ต้องเริ่มต้นใหม่ทุกครั้ง

บริษัทกล่าวว่ากำลังทำงานร่วมกับพันธมิตรด้านฮาร์ดแวร์ที่เชื่อถือได้เพื่อขยายแพลตฟอร์ม และได้เผยแพร่เอกสารความรับผิดชอบและความปลอดภัยควบคู่ไปกับการเปิดตัว ยังคงมีคำถามว่าโมเดลเหล่านี้ทำงานอย่างไรนอกเหนือจากการสาธิตที่มีการควบคุม และการควบคุมแบบมนุษย์ทั้งร่างกายสามารถเปลี่ยนไปสู่การใช้งานจริงที่เชื่อถือได้ได้อย่างรวดเร็วเพียงใด

อย่างไรก็ตาม ความกว้างของการเปิดตัว — การเคลื่อนไหวทั้งร่างกาย การใช้เหตุผลหลายขั้นตอน ประสิทธิภาพบนอุปกรณ์ และการประสานงานหลายตัวแทนในตระกูลผลิตภัณฑ์เดียว — ส่งสัญญาณว่า Google ตั้งใจที่จะเป็นผู้เล่นหลักในการบรรจบกันของโมเดล AI ขนาดใหญ่และเครื่องจักรทางกายภาพ

ก้าวนำหน้า AI

ขอบเขตด้านวิทยาการหุ่นยนต์กำลังดำเนินไปอย่างรวดเร็ว และ AI Buzz Wire กำลังติดตามการพัฒนาที่สำคัญทุกประการ อ่านข่าว AI เพิ่มเติม สำหรับการรายงานข่าวโมเดล การพัฒนาฮาร์ดแวร์ และการเปลี่ยนแปลงของอุตสาหกรรมอย่างต่อเนื่อง

สำรวจการพัฒนา AI ล่าสุด →