Gemini Robotics 2: Trzy “mózgi”, pełne zarządzanie anatomią i precyzja zegarmistrza

Google DeepMind zaprezentowało system Gemini Robotics 2, który wprowadza sterowanie robotami humanoidalnymi na zupełnie nowy poziom precyzji. Rozwiązanie to pozwala maszynom na koordynację całego korpusu oraz wykonywanie skomplikowanych prac manualnych, które dotąd były domeną wyłącznie ludzkich rąk.

 

Trzy modele tworzące cyfrowy mózg robota

System składa się z trzech wyspecjalizowanych modułów, które współpracują ze sobą w czasie rzeczywistym, tworząc spójny ekosystem. Model VLA odpowiada za bezpośrednie sterowanie ruchem i chwytakami, zapewniając wysoką zręczność przy użyciu obu rąk. Z kolei wersja ER 2 pełni funkcję zaawansowanego mózgu, który planuje zadania, analizuje otoczenie i pozwala robotowi na komunikację z ludźmi. Uzupełnieniem jest wariant On-Device, przetwarzający dane lokalnie na komputerze pokładowym maszyny. Dzięki temu robot może błyskawicznie reagować na zmiany w otoczeniu bez opóźnień wynikających z przesyłania informacji do zewnętrznej chmury, co pozwala również na szybkie dostosowanie oprogramowania do nowych konstrukcji mechanicznych.

 

 

Pełna kontrola ruchu i precyzja godna zegarmistrza

W przeciwieństwie do starszych systemów skupionych głównie na ramionach i dłoniach, Gemini Robotics 2 zarządza całą anatomią robota, umożliwiając mu stabilne chodzenie, kucanie czy schylanie się. Prawdziwy postęp widać jednak w zręczności palców, które dysponują aż 22 stopniami swobody ruchu. Tak zaawansowana mechanika pozwala maszynom na wykonywanie niezwykle precyzyjnych czynności, takich jak wiązanie węzłów, wkręcanie żarówek czy operowanie bardzo małymi przedmiotami. Co więcej, nowa technologia umożliwia grupie robotów płynną współpracę, dzięki czemu maszyny mogą dzielić między siebie etapy jednego, złożonego procesu.

 

 

Bezpieczeństwo i dostępność nowej technologii

Inżynierowie DeepMind połączyli zaawansowane możliwości ruchu z rygorystycznymi normami ochrony osób znajdujących się w otoczeniu maszyny. Nowy model potrafi rozpoznawać ludzi w pobliżu i automatycznie zatrzymać ruch przed kontaktem fizycznym. Wprowadzono także otwarty standard ASIMOV-Agentic, który sprawdza, czy sztuczna inteligencja potrafi poprawnie ocenić wykonalność zadania i odrzucić potencjalnie niebezpieczne polecenia. Obecnie model ER 2 jest już dostępny w Google AI Studio, natomiast wersje sterujące ruchem i działające lokalnie trafiły do testów w ramach wczesnego dostępu dla partnerów technologicznych.