Anunțată pe 30 iulie 2026, lansarea se concentrează pe un model viziune-limbaj-acțiune (VLA) care convertește ceea ce vede și aude un robot în comenzi motorii precise. DeepMind îl descrie drept stratul de inteligență pentru robotica de uz general, iar compania a poziționat lansarea ca un punct de cotitură în scoaterea AI din ferestrele de chat și în lumea fizică. Pentru mai multe despre impulsul industriei către IA întruchipată, urmăriți știrile de ultimă oră AI.
Trei modele, un sistem
DeepMind a livrat trei modele complementare în gama Gemini Robotics 2:
- Gemini Robotics 2 — modelul emblematic VLA care traduce viziunea și limbajul în control motor, permițând unui robot să acționeze fizic.
- Gemini Robotics ER 2 — un model de raționament întruchipat capabil să înțeleagă spațiile fizice și să producă planuri detaliate, în mai mulți pași, care se coordonează cu oamenii și alți roboți.
- Gemini Robotics On-Device 2 — o versiune ușoară a modelului VLA optimizată pentru a rula local pe hardware robotic, reducând dependența de conectivitatea la cloud.
Potrivit blogului DeepMind, fiecare model are un rol de specialist, dar trio-ul este conceput să funcționeze ca un singur sistem integrat. Modelul VLA se ocupă de acțiunea în timp real, modelul ER se ocupă de planificarea la nivel superior, iar varianta pe dispozitiv permite răspunsuri cu latență scăzută asupra robotului însuși.
De la picioare până la vârful degetelor
Cea mai frapantă afirmație din anunț este ceea ce DeepMind numește control inteligent al întregului corp. În loc să antreneze un robot să repete o mișcare, Gemini Robotics 2 este proiectat să comandă un întreg corp umanoid - de la picioare până la vârful degetelor - permițând mișcări asemănătoare unui om, inclusiv îndoirea, atingerea și echilibrarea.
DeepMind a evidențiat mai multe repere de dexteritate. În cadrul demonstrațiilor, roboții propulsați de model au fost prezentați înșuruband becuri, făcând noduri și efectuând alte acțiuni delicate care necesită control fin al motorului. Laboratorul a spus că sistemul atinge un nou nivel de dexteritate care le permite roboților să îndeplinească sarcini care necesită finețe autentică, mai degrabă decât repetiție brutală.
De asemenea, compania a subliniat adaptabilitatea. Gemini Robotics 2 poate fi adaptat oricărui robot cu două brațe în doar câteva ore, a spus DeepMind, ceea ce înseamnă că aceeași inteligență subiacentă se poate scala de la un braț de masă la un umanoid complex fără un ciclu complet de reantrenare. Această generalizare este o abatere semnificativă de la robotica convențională, unde fiecare mașină necesită de obicei un software special conceput.
Roboții care lucrează împreună
O altă capacitate principală este colaborarea multi-robot. DeepMind a spus că Gemini Robotics 2 acceptă scenarii în care doi roboți lucrează împreună la o singură sarcină, împărțind munca într-un spațiu fizic comun. Modelul ER 2 se ocupă de coordonare - raționamentul despre mediu, cartografierea unei secvențe cu mai mulți pași și alocarea pașilor între mașini.
Într-o demonstrație citată de companie, o pereche de roboți au colaborat pentru a curăța o cameră, împărțind munca în loc să se ciocnească unul de altul. DeepMind a încadrat acest lucru ca o dovadă timpurie că AI poate gestiona nu doar acțiunile individuale, ci și orchestrarea mai multor agenți în lumea reală.
Interactiv și instructibil
Dincolo de funcționarea autonomă, modelele sunt concepute pentru a fi interactive. Gemini Robotics 2 își poate explica abordarea în timp ce efectuează o acțiune, iar utilizatorii pot redirecționa un robot la mijlocul sarcinii folosind limbajul de zi cu zi, mai degrabă decât comenzile tehnice. DeepMind a spus că acest lucru face ca platforma să fie potrivită pentru instruirea roboților în medii volatile sau periculoase în care operatorii umani trebuie să ajusteze planurile din mers.
De ce contează
Lansarea intensifică o cursă deja aglomerată de umanoid-robotică. Companii precum Figure, Boston Dynamics și Tesla s-au întrecut pentru a comercializa mașini care lucrează pe jos, în timp ce producătorii de cipuri precum Nvidia au investit masiv în infrastructura de simulare și calcul pe care o necesită AI fizică.
Pariul lui DeepMind este că un singur strat de inteligență de uz general – unul care raționează despre lumea fizică așa cum un chatbot raționează despre text – poate înlocui software-ul personalizat, restrâns, care a definit robotica industrială de zeci de ani. Dacă sistemul se poate adapta într-adevăr la orice formă de realizare în câteva ore, ar reduce bariera pentru producători și cercetători care doresc să implementeze roboți capabili fără a începe de la zero de fiecare dată.
Compania a spus că lucrează cu parteneri hardware de încredere pentru a extinde platforma și a publicat documentația privind responsabilitatea și siguranța alături de lansare. Rămân întrebări despre modul în care aceste modele funcționează în afara demonstrațiilor controlate și cât de repede se poate traduce controlul umanoid al întregului corp într-o implementare fiabilă, în lumea reală.
Cu toate acestea, amploarea lansării - mișcarea întregului corp, raționament în mai mulți pași, eficiență pe dispozitiv și coordonare multi-agenți într-o singură familie de produse - semnalează că Google intenționează să fie un jucător principal în convergența modelelor AI mari și a mașinilor fizice.
Rămâi înaintea AI
Frontiera roboticii se mișcă rapid, iar AI Buzz Wire urmărește fiecare dezvoltare majoră. Citiți mai multe știri despre AI pentru o acoperire continuă a lansărilor de modele, a descoperirilor hardware și a schimbărilor din industrie.
Explorați cele mai recente evoluții AI →