Dix-huit ans d'enregistrements d'écran, et pas un seul clic annoté
Internet regorge de vidéos où des gens se servent d'un ordinateur, sans que personne n'ait jamais noté quel clic a été fait à quel moment. Induction Labs propose d'y puiser malgré tout, avec une architecture qu'elle nomme imagination models. Le principe consiste à entraîner un modèle à prédire l'état suivant d'une vidéo, non pas en pixels mais dans un espace de représentation. Son premier spécimen, Photon-1, a été nourri de dix-huit ans d'enregistrements d'écran, sans qu'aucune action ne lui soit désignée.
Le résultat central tient dans un apprentissage que personne n'a enseigné. À force de prédire ce qui va s'afficher, le modèle apprend implicitement à agir. Après un réglage léger, destiné à lui faire adopter le format des commandes clavier et souris, Photon-1 imagine d'abord l'écran suivant, puis produit l'action qui y conduit. Un apprentissage par renforcement mené sur des machines virtuelles, dont les résultats sont vérifiés automatiquement, améliore ensuite sa compétence.
Rien de tout cela ne tiendrait sans l'encodeur visuel maison, qui comprime chaque image en 960 tokens discrets, environ 2,2 kilooctets, soit une centaine de fois moins que les représentations habituelles des modèles multimodaux, tout en préservant le texte, la mise en page et les changements d'état. Sur ses propres tests d'usage d'ordinateur, le laboratoire situe Photon-1 devant Gemini 3.1 Flash-Lite, avec un entraînement qu'il estime trente fois moins gourmand en calcul et un coût de service trois fois inférieur.
Deux effets retiennent l'attention au-delà du score. Bien qu'il n'ait jamais vu autre chose que des écrans, le modèle transfère ses représentations ailleurs : réglé sur des parties de dames puis sur des simulations de billard, il devance des références entraînées sur les mêmes données, aussi bien pour anticiper l'évolution d'un plateau que pour restituer une trajectoire de boule. Il a surtout hérité des habitudes humaines contenues dans ses vidéos, au point de solliciter ChatGPT, d'en relire la réponse et de le réorienter jusqu'à obtenir ce qu'il cherche. L'équipe, deux personnes basées à San Francisco, compte étendre l'approche à d'autres vidéos non étiquetées, gestes du monde physique et travail qualifié compris.