OpenAI publie MRC, son protocole réseau pour les clusters d'entraînement à grande échelle
OpenAI publie MRC, un protocole réseau libre créé avec NVIDIA et Microsoft pour fiabiliser l'entraînement d'IA sur de très grands clusters de GPU.
OpenAI ouvre les spécifications de MRC (Multipath Reliable Connection), un protocole réseau développé pendant deux ans avec AMD, Broadcom, Intel, Microsoft et NVIDIA pour fiabiliser la communication entre GPU dans les supercalculateurs d'entraînement IA. La spécification est versée à l'Open Compute Project, ce qui la rend exploitable par l'ensemble de l'industrie.
Le problème adressé est connu de tout opérateur de cluster massif : à mesure que le nombre de GPU augmente, les défaillances de liens et les congestions ponctuelles deviennent inévitables, et un seul incident peut bloquer un entraînement synchrone mobilisant des dizaines de milliers de cartes. MRC contourne cette fragilité en répartissant chaque transfert sur des centaines de chemins simultanés et en isolant en quelques microsecondes une route défectueuse, là où une architecture classique pouvait demander plusieurs secondes pour se reconfigurer.
Le protocole s'intègre aux interfaces réseau 800 Gb/s les plus récentes et permet de réduire la topologie des grands clusters à deux niveaux de commutateurs au lieu de trois ou quatre, avec à la clé une consommation électrique moindre et moins de composants susceptibles de tomber en panne. MRC tourne déjà sur les plus gros supercalculateurs NVIDIA GB200 d'OpenAI, dont le site Stargate d'Abilene au Texas opéré avec Oracle Cloud Infrastructure et l'infrastructure Fairwater de Microsoft, et a servi à entraîner plusieurs modèles maison.
L'ouverture du standard s'inscrit dans une stratégie assumée : plutôt que de garder cette brique propriétaire, OpenAI parie sur une normalisation à l'échelle du secteur pour faire bouger l'écosystème matériel dont dépendent les futurs modèles de frontière.