Google DeepMind repense le curseur de souris à l'ère de l'IA générative

Google DeepMind dévoile un prototype de curseur intelligent animé par Gemini pour exécuter des tâches contextuelles sans changer d'application à l'écran.

Google DeepMind présente un prototype de curseur intelligent piloté par Gemini, conçu pour étendre la fonction du pointeur au-delà de la simple coordonnée à l'écran. L'idée portée par les chercheurs Adrien Baranes, PhD. et Rob Marchant : amener l'IA là où l'utilisateur travaille, plutôt que de l'obliger à basculer dans une application dédiée à chaque demande.

Le système repose sur quatre principes d'interaction. Le premier consiste à maintenir le flux de travail : le curseur peut être interpellé sur n'importe quelle application pour résumer un PDF en bullet points, transformer un tableau en camembert ou doubler la quantité d'ingrédients d'une recette. Le deuxième s'appuie sur la captation automatique du contexte visuel et sémantique autour du pointeur, ce qui dispense de rédiger un prompt détaillé. Le troisième mise sur le langage du quotidien, fait de "this" et de "that", combiné au geste. Le quatrième transforme les pixels en entités exploitables : une note manuscrite photographiée devient une to-do list interactive, une image figée d'une vidéo de voyage débouche sur un lien de réservation de restaurant.

Les premières applications concrètes sont intégrées à Chrome, où Gemini peut désormais être sollicité sur une portion précise d'une page web (comparer plusieurs produits sélectionnés, projeter un canapé dans son salon). Une fonction baptisée Magic Pointer doit également arriver sur Googlebook, le nouvel ordinateur portable de la firme, et d'autres tests sont prévus dans Google Labs Disco. Le prototype est manipulable dès maintenant dans Google AI Studio sur deux cas d'usage : l'édition d'image et la recherche de lieux sur carte.