220 millions de dollars pour entraîner des agents sur des milliards de parties
General Intuition lève 220 millions de dollars pour une valorisation de 6,2 milliards et commence à ouvrir l'accès à ses foundation models. Entraînés sur les vidéos de gameplay de Medal associées aux actions des joueurs, ils ciblent les jeux, la simulation et la robotique.
Une nouvelle levée quelques mois après la précédente
La valorisation de General Intuition atteint 6,2 milliards de dollars avec un nouveau financement de 220 millions. Le tour réunit Valor Equity Partners, Atreides, 776, Point72, Khosla Ventures et General Catalyst.
Cette opération intervient quelques mois après une précédente levée de 320 millions de dollars, réalisée sur une valorisation de 2,3 milliards. Des discussions autour du nouveau financement avaient ensuite été rapportées en août par TechCrunch, avec une valorisation pre-money alors évoquée autour de 6 milliards de dollars.
General Intuition prévoit désormais d'augmenter ses capacités de calcul et de renforcer ses équipes à New York et en Europe. Des vidéos accompagnées des actions du joueur
La particularité du corpus vient de Medal, la plateforme de clips de jeux vidéo dont General Intuition est issue. Les données ne comprennent pas uniquement ce qui apparaît à l'écran : elles associent les vidéos aux actions réalisées par les joueurs avec leurs contrôleurs.
General Intuition affirme pouvoir entraîner ses modèles sur des milliards de vidéos ainsi associées à des actions. Medal se dirige, selon l'entreprise, vers trois milliards de vidéos mises en ligne chaque année.
Cette combinaison entre vision et commandes constitue le cœur de la méthode. Le modèle peut observer une situation, l'action choisie par une personne et ce qui se produit ensuite.
General Intuition décrit sur son site deux composantes complémentaires : des modèles d'action chargés de déterminer quoi faire et des World Models capables d'anticiper les conséquences de ces actions. Du jeu vidéo vers la robotique
Le pari consiste ensuite à transférer ces apprentissages vers des environnements différents de ceux rencontrés pendant l'entraînement.
General Intuition développe des foundation models destinés à percevoir, prédire et agir dans des espaces virtuels comme physiques. L'entreprise rapproche le fonctionnement d'un jeu vidéo de celui de la téléopération robotique : dans les deux cas, une personne observe un environnement et utilise des commandes pour agir dessus.
Lors d'une précédente démonstration examinée par TechCrunch, un même système avait été utilisé pour jouer de manière autonome puis contrôler un robot quadrupède. General Intuition indiquait avoir ajouté huit minutes de données robotiques pour cette seconde tâche.
La capacité à généraliser ce transfert à davantage de machines et de situations physiques reste encore à démontrer. Des World Models entraînés à grande échelle
Les données de Medal alimentent également les recherches de General Intuition autour des World Models.
Parmi ses travaux figure MIRA, développé avec Kyutai en collaboration avec Epic Games. Le système apprend la dynamique de parties de Rocket League à quatre joueurs à partir de 10 000 heures de données et fonctionne en temps réel à 20 images par seconde.
General Intuition avance un argument d'échelle pour expliquer cette stratégie. Le nombre de situations inhabituelles rencontrées dans des environnements simulés ou vidéoludiques pourrait fournir aux modèles davantage de cas rares que des systèmes entraînés exclusivement dans le monde physique.
L'entreprise affirme que les principaux foundation models consacrés à la robotique et aux World Models utilisent moins de 1 % du volume de données d'action auquel elle peut accéder. Aucun protocole détaillé permettant de vérifier cette comparaison n'accompagne toutefois cette affirmation. Les modèles commencent à sortir du laboratoire
Cette levée accompagne les premières ouvertures commerciales de la technologie. General Intuition indique commencer à mettre ses modèles à disposition et ouvre une liste d'attente destinée aux partenaires souhaitant bénéficier d'un accès anticipé.
Le laboratoire affirme avoir conçu une nouvelle classe de foundation models capable d'agir en temps réel dans des environnements jamais rencontrés auparavant. Les résultats détaillés permettant d'évaluer cette généralisation ne sont pas encore publiés avec cette annonce.
Les premiers usages visés couvrent les jeux vidéo, la simulation et la robotique, tandis que les 220 millions de dollars supplémentaires doivent accompagner le passage de ces travaux de recherche vers une utilisation plus large.