Un cerveau de coordination pour les robots et leurs actions

Gemini Robotics ER 2 organise les actions des machines en continu par analyse vidéo. Ce que ce modèle de Google DeepMind change pour la robotique.

Pensé comme une couche de raisonnement placée au-dessus des commandes motrices, Gemini Robotics ER 2 permet à un robot d’interpréter une demande, d’observer son environnement et d’organiser une tâche en plusieurs étapes. Le modèle ne contrôle pas directement chaque mouvement. Il transmet ses décisions à un modèle vision-langage-action, à une API de navigation ou à toute autre interface déclarée par le développeur.

Google DeepMind ajoute une compréhension continue de la vidéo. Pendant qu’un robot agit, ER 2 suit sa progression, vérifie qu’une étape est réellement terminée et adapte son plan lorsqu’un problème survient. Cette approche doit limiter les pauses pendant lesquelles la machine s’arrête pour analyser la suite, grâce à une connexion bidirectionnelle avec la Gemini Live API.

Sur les évaluations publiées par l’entreprise, le modèle atteint 57,4 % de précision pour classer l’avancement d’une tâche selon cinq niveaux. Il obtient également 91,3 % sur la détection du moment exact où un événement se produit dans une vidéo, avec un écart moyen de 0,96 seconde. Cette capacité peut servir à déterminer quand arrêter de verser un liquide, passer à l’étape suivante ou recommencer une action incomplète.

La collaboration entre plusieurs machines fait aussi partie de cette version. Des robots aux caractéristiques différentes peuvent partager une compréhension commune de la mission, se répartir les opérations et se transmettre une tâche. Google DeepMind illustre cette fonction avec des équipements d’Apptronik, Boston Dynamics et Agile Robots, notamment pour la récupération d’objets et les scénarios nécessitant plusieurs systèmes.

La sécurité progresse parallèlement avec une meilleure détection de la proximité humaine. Dans les démonstrations de Google, le système peut interrompre le mouvement d’un humanoïde lorsqu’une personne entre dans sa zone de travail, puis reprendre une fois l’espace dégagé. Gemini Robotics ER 2 est accessible aux développeurs via la Gemini API et Google AI Studio, ainsi qu’en préversion privée sur Gemini Enterprise Agent Platform.