FLUX 3 Action associe prédiction vidéo et commandes robotiques dans un modèle de 7 milliards de paramètres

Black Forest Labs publie FLUX 3 Action, un World Action Model open-weight de 7 milliards de paramètres destiné au contrôle robotique. Sur RoboLab-120, ses variantes atteignent jusqu’à 42,2 % de réussite dans les évaluations détaillées par l’équipe, avec une inférence accélérée par distillation.

Black Forest Labs publie FLUX 3 Action, un World Action Model open-weight de 7 milliards de paramètres destiné au contrôle robotique. Sur RoboLab-120, ses variantes atteignent jusqu’à 42,2 % de réussite dans les évaluations détaillées par l’équipe, avec une inférence accélérée par distillation. De la génération vidéo à la prédiction d’actions

Un robot doit anticiper les conséquences de ses mouvements, exécuter une partie de son plan, puis observer à nouveau son environnement. Avec FLUX 3 Action , Black Forest Labs applique son modèle multimodal FLUX 3 à cette boucle de contrôle.

Le système reçoit une instruction, des images issues des caméras et l’état des articulations. Il prédit conjointement les prochaines commandes motrices et les images correspondant à leur exécution. Contrairement à une architecture qui génère d’abord une vidéo avant d’en déduire les actions, les deux sorties sont produites par le même modèle. Un pré-entraînement largement fondé sur la vidéo

Le modèle de 7 milliards de paramètres hérite d’un pré-entraînement mêlant images, vidéo et audio, la vidéo représentant plus de 95 % des tokens utilisés. Une phase intermédiaire ajoute des données d’actions : séquences de jeux vidéo, vidéos égocentriques annotées, manipulation avec pinces et téléopération sur 14 configurations robotiques.

Les tests de Black Forest Labs indiquent que ce pré-entraînement multimodal améliore la capacité du modèle à apprendre des actions à partir de données robotiques limitées. Le modèle est ensuite adapté à une configuration matérielle et à son espace de commandes, notamment au moyen du dataset DROID. Jusqu’à 42,2 % de réussite sur RoboLab

Sur le benchmark simulé RoboLab-120, la variante guidance-distilled atteint 42,24 % de réussite en FP8 dans les mesures publiées par l’équipe. La variante step-distilled, qui réduit l’inférence à une seule étape, atteint 37,92 %, contre 36,8 % pour Cosmos 3 Nano dans la comparaison présentée.

La distillation réduit le coût de calcul sans séparer les prédictions vidéo et action. Selon le matériel et la précision utilisés, Black Forest Labs mesure une accélération de 1,52 à 3,95 fois par rapport à Cosmos 3 Nano. La version à une étape échange une partie de son taux de réussite contre une inférence plus rapide. Ces gains portent sur le temps de calcul rapporté à la durée du mouvement prédit, et non systématiquement sur la latence d’un appel individuel.

Une évaluation réalisée par Positronic Robotics sur un bras Franka fournit également des résultats physiques. Sur dix tâches DROID, avec trois tentatives par tâche, FLUX 3 Action réussit 28 essais sur 30. Cosmos 3 Nano en réussit 27, DreamZero 20 et π0.5 13 dans ce protocole. L’échantillon reste limité à 30 tentatives par modèle. Un modèle rapide sous la supervision d’un raisonneur

Black Forest Labs a aussi testé une architecture hybride associant FLUX 3 Action à GPT-6 Astra. Le modèle robotique propose les mouvements, tandis qu’Astra examine les observations et peut accepter, corriger ou remplacer certaines commandes lorsque la tâche exige davantage de planification.

Dans le protocole publié, la configuration hybride avec Astra en effort faible résout 45 épisodes sur 50, pour un coût estimé à 8,77 dollars et un temps moyen de 8 minutes et 8 secondes par réussite. Astra utilisé seul en effort maximal résout les 50 épisodes, mais avec un coût et un temps supérieurs. Ces chiffres concernent ce protocole de simulation et ses hypothèses tarifaires, pas le coût d’exploitation d’un robot réel.

Les poids de FLUX 3 Action sont publiés en open-weight, accompagnés du rapport technique et de la méthode de fine-tuning. Black Forest Labs explore également les jeux vidéo comme environnement d’évaluation pour les politiques d’action, au-delà de la manipulation robotique.