ประกาศเมื่อวันที่ 30 กรกฎาคม 2026 การเปิดตัวมุ่งเน้นไปที่โมเดลการมองเห็นภาษาการกระทำ (VLA) ซึ่งจะแปลงสิ่งที่หุ่นยนต์มองเห็นและได้ยินเป็นคำสั่งมอเตอร์ที่แม่นยำ DeepMind อธิบายว่ามันเป็นชั้นอัจฉริยะสำหรับหุ่นยนต์เอนกประสงค์ และบริษัทได้วางตำแหน่งการเปิดตัวเป็นจุดเปลี่ยนในการนำ AI ออกจากหน้าต่างแชทและเข้าสู่โลกทางกายภาพ หากต้องการข้อมูลเพิ่มเติมเกี่ยวกับการผลักดันอุตสาหกรรมในวงกว้างไปสู่ AI ที่เป็นรูปเป็นร่าง โปรดติดตาม ข่าวด่วน AI ของเรา
สามรุ่น หนึ่งระบบ
DeepMind จัดส่งโมเดลเสริมสามรุ่นในกลุ่มผลิตภัณฑ์ Gemini Robotics 2:
- Gemini Robotics 2 — โมเดล VLA เรือธงที่แปลการมองเห็นและภาษาเป็นการควบคุมมอเตอร์ ซึ่งช่วยให้หุ่นยนต์สามารถเคลื่อนไหวร่างกายได้
- Gemini Robotics ER 2 — โมเดลที่ให้เหตุผลเป็นตัวเป็นตนที่สามารถทำความเข้าใจพื้นที่ทางกายภาพและสร้างแผนงานหลายขั้นตอนโดยละเอียดที่ประสานงานกับมนุษย์และหุ่นยนต์อื่นๆ
- Gemini Robotics บนอุปกรณ์ 2 — รุ่น VLA เวอร์ชันน้ำหนักเบาที่ได้รับการปรับแต่งให้ทำงานบนฮาร์ดแวร์หุ่นยนต์ในเครื่อง ซึ่งช่วยลดการพึ่งพาการเชื่อมต่อระบบคลาวด์
ตามบล็อกของ DeepMind แต่ละรุ่นมีบทบาทเป็นผู้เชี่ยวชาญ แต่ทั้งสามรุ่นได้รับการออกแบบมาให้ทำงานเป็นระบบบูรณาการเดียว โมเดล VLA จัดการการดำเนินการแบบเรียลไทม์ โมเดล ER จัดการการวางแผนในระดับที่สูงขึ้น และตัวแปรบนอุปกรณ์ช่วยให้หุ่นยนต์ตอบสนองเวลาแฝงต่ำได้
จากเท้าถึงปลายนิ้ว
คำกล่าวอ้างที่โดดเด่นที่สุดในการประกาศคือสิ่งที่ DeepMind เรียกว่าการควบคุมทั้งร่างกายอย่างชาญฉลาด แทนที่จะฝึกหุ่นยนต์ให้ทำซ้ำการเคลื่อนไหว Gemini Robotics 2 ได้รับการออกแบบมาเพื่อควบคุมร่างกายของมนุษย์ทั้งหมด ตั้งแต่เท้าไปจนถึงปลายนิ้ว ช่วยให้สามารถเคลื่อนไหวได้เต็มรูปแบบเหมือนมนุษย์ รวมถึงการงอ เอื้อมมือ และทรงตัว
DeepMind เน้นย้ำเกณฑ์มาตรฐานด้านความคล่องตัวหลายประการ ในการสาธิต หุ่นยนต์ที่ขับเคลื่อนโดยโมเดลดังกล่าวจะถูกแสดงการขันหลอดไฟ ผูกปม และดำเนินการละเอียดอ่อนอื่นๆ ที่ต้องมีการควบคุมมอเตอร์อย่างละเอียด ห้องปฏิบัติการกล่าวว่าระบบนี้ได้รับความคล่องแคล่วในระดับใหม่ ซึ่งช่วยให้หุ่นยนต์สามารถทำงานที่ต้องใช้ความประณีตอย่างแท้จริง แทนที่จะทำซ้ำอย่างดุเดือด
บริษัทยังเน้นย้ำถึงความสามารถในการปรับตัว Gemini Robotics 2 สามารถปรับให้เข้ากับหุ่นยนต์สองแขนได้ภายในเวลาเพียงไม่กี่ชั่วโมง DeepMind กล่าว ซึ่งหมายความว่าหน่วยสืบราชการลับเดียวกันนี้สามารถขยายขนาดจากแขนบนโต๊ะไปเป็นหุ่นยนต์ฮิวแมนนอยด์ที่ซับซ้อนได้โดยไม่ต้องมีการฝึกอบรมซ้ำทั้งหมด ลักษณะทั่วไปนี้แตกต่างไปจากวิทยาการหุ่นยนต์ทั่วไปอย่างมาก โดยที่เครื่องจักรแต่ละเครื่องมักจะต้องใช้ซอฟต์แวร์ที่สร้างขึ้นตามวัตถุประสงค์เฉพาะ
หุ่นยนต์ทำงานร่วมกัน
ความสามารถพาดหัวอีกประการหนึ่งคือการทำงานร่วมกันหลายหุ่นยนต์ DeepMind กล่าวว่า Gemini Robotics 2 รองรับสถานการณ์ที่หุ่นยนต์สองตัวทำงานร่วมกันในงานเดียว โดยแบ่งงานในพื้นที่ทางกายภาพที่ใช้ร่วมกัน แบบจำลอง ER 2 จัดการการประสานงาน — การให้เหตุผลเกี่ยวกับสภาพแวดล้อม การจัดทำแผนผังลำดับหลายขั้นตอน และการจัดสรรขั้นตอนระหว่างเครื่องจักร
ในการสาธิตครั้งหนึ่งที่บริษัทอ้างถึง หุ่นยนต์คู่หนึ่งร่วมมือกันทำความสะอาดห้อง โดยแบ่งงานแทนที่จะชนกัน DeepMind มองว่าสิ่งนี้เป็นหลักฐานในช่วงแรกๆ ที่ว่า AI สามารถจัดการได้ไม่เพียงแค่การกระทำของแต่ละบุคคลเท่านั้น แต่ยังรวมถึงการจัดการตัวแทนหลายรายในโลกแห่งความเป็นจริงด้วย
โต้ตอบและสอนได้
นอกเหนือจากการทำงานแบบอัตโนมัติแล้ว โมเดลต่างๆ ยังได้รับการออกแบบมาให้สามารถโต้ตอบได้ Gemini Robotics 2 สามารถอธิบายแนวทางในขณะที่ดำเนินการ และผู้ใช้สามารถเปลี่ยนเส้นทางหุ่นยนต์ระหว่างทำงานโดยใช้ภาษาในชีวิตประจำวัน แทนที่จะใช้คำสั่งทางเทคนิค DeepMind กล่าวว่าสิ่งนี้ทำให้แพลตฟอร์มนี้เหมาะอย่างยิ่งสำหรับการสอนหุ่นยนต์ในสภาพแวดล้อมที่มีความผันผวนหรือเป็นอันตราย ซึ่งผู้ปฏิบัติงานที่เป็นมนุษย์จำเป็นต้องปรับแผนได้ทันที
ทำไมมันถึงสำคัญ
การเปิดตัวครั้งนี้ทำให้การแข่งขันหุ่นยนต์ฮิวแมนนอยด์มีผู้เข้าร่วมหนาแน่นมากขึ้น บริษัทต่างๆ เช่น Figure, Boston Dynamics และ Tesla ต่างแข่งขันกันเพื่อจำหน่ายเครื่องจักรสำหรับเดินและใช้งาน ในขณะที่ผู้ผลิตชิป เช่น Nvidia ได้ลงทุนมหาศาลในโครงสร้างพื้นฐานด้านการจำลองและการคำนวณที่ AI ทางกายภาพต้องการ
การเดิมพันของ DeepMind ก็คือเลเยอร์อัจฉริยะสำหรับใช้งานทั่วไปเพียงชั้นเดียว — ซึ่งเป็นชั้นที่ให้เหตุผลเกี่ยวกับโลกทางกายภาพเช่นเดียวกับที่แชทบอทให้เหตุผลเกี่ยวกับข้อความ — สามารถแทนที่ซอฟต์แวร์แคบๆ ที่ออกแบบตามความต้องการซึ่งกำหนดนิยามของหุ่นยนต์อุตสาหกรรมมานานหลายทศวรรษ หากระบบสามารถปรับให้เข้ากับรูปลักษณ์ใดๆ ได้ภายในไม่กี่ชั่วโมง มันจะลดอุปสรรคสำหรับผู้ผลิตและนักวิจัยที่ต้องการปรับใช้หุ่นยนต์ที่มีความสามารถโดยไม่ต้องเริ่มต้นใหม่ทุกครั้ง
บริษัทกล่าวว่ากำลังทำงานร่วมกับพันธมิตรด้านฮาร์ดแวร์ที่เชื่อถือได้เพื่อขยายแพลตฟอร์ม และได้เผยแพร่เอกสารความรับผิดชอบและความปลอดภัยควบคู่ไปกับการเปิดตัว ยังคงมีคำถามว่าโมเดลเหล่านี้ทำงานอย่างไรนอกเหนือจากการสาธิตที่มีการควบคุม และการควบคุมแบบมนุษย์ทั้งร่างกายสามารถเปลี่ยนไปสู่การใช้งานจริงที่เชื่อถือได้ได้อย่างรวดเร็วเพียงใด
อย่างไรก็ตาม ความกว้างของการเปิดตัว — การเคลื่อนไหวทั้งร่างกาย การใช้เหตุผลหลายขั้นตอน ประสิทธิภาพบนอุปกรณ์ และการประสานงานหลายตัวแทนในตระกูลผลิตภัณฑ์เดียว — ส่งสัญญาณว่า Google ตั้งใจที่จะเป็นผู้เล่นหลักในการบรรจบกันของโมเดล AI ขนาดใหญ่และเครื่องจักรทางกายภาพ
ก้าวนำหน้า AI
ขอบเขตด้านวิทยาการหุ่นยนต์กำลังดำเนินไปอย่างรวดเร็ว และ AI Buzz Wire กำลังติดตามการพัฒนาที่สำคัญทุกประการ อ่านข่าว AI เพิ่มเติม สำหรับการรายงานข่าวโมเดล การพัฒนาฮาร์ดแวร์ และการเปลี่ยนแปลงของอุตสาหกรรมอย่างต่อเนื่อง
สำรวจการพัฒนา AI ล่าสุด →