Maison
OpenAI et NVIDIA s'associent pour développer le protocole MRC afin de transformer les réseaux d'entraînement en IA
OpenAI a officiellement annoncé une collaboration avec cinq leaders du secteur — AMD, Broadcom, Intel, Microsoft et NVIDIA — en vue du lancement du protocole MRC (Multipath Reliable Connection). Ce protocole open source, publié dans le cadre de l'Open Compute Project (OCP), est conçu pour remédier aux problèmes de latence et aux pannes réseau fréquemment rencontrés lors de l'entraînement de l'IA à grande échelle.

Éliminer le « point de défaillance unique » : passer d'une architecture à trois niveaux à une architecture à deux niveaux
Dans l'entraînement traditionnel des modèles d'IA, la congestion du réseau ou une défaillance mineure sur une seule liaison peut se propager en cascade, comme des dominos, forçant des dizaines de milliers de GPU à passer en état d'inactivité et entraînant un gaspillage informatique considérable.
Afin d’améliorer fondamentalement la résilience du système, le protocole MRC introduit une conception de réseau multiplan. Il divise intelligemment une interface unique de 800 Gb/s en plusieurs liaisons plus petites. Cette optimisation structurelle permet au système de prendre en charge des clusters massifs comptant jusqu’à environ 131 000 GPU en utilisant seulement deux couches de commutation. Par rapport aux architectures traditionnelles à deux ou quatre niveaux, cette évolution réduit non seulement de manière drastique le nombre de composants physiques et la consommation d'énergie, mais diminue également considérablement les coûts de construction.
Gestion avancée du trafic : « pulvérisation » de paquets et récupération à l'échelle de la microseconde
Au-delà de la simplification architecturale, le MRC introduit une approche novatrice de la distribution du trafic. Il utilise une technologie de « pulvérisation » adaptative des paquets, s'éloignant de la transmission traditionnelle à chemin unique. Cette méthode décompose les paquets de tâches et les distribue sur des centaines de chemins parallèles. Même si les paquets arrivent dans le désordre, le récepteur peut les réassembler avec précision, empêchant ainsi efficacement la congestion localisée au sein du réseau central.
Pour le contrôle du réseau, le MRC remplace les protocoles de routage dynamique complexes (tels que le BGP) par la technologie de routage par source SRv6. Cela permet à l’expéditeur de spécifier directement le chemin, tandis que les commutateurs n’effectuent qu’un simple transfert statique. Cette conception réduit le temps de récupération en cas de défaillance du réseau de quelques secondes à quelques microsecondes, permettant au système d’atteindre une « auto-réparation quasi transparente » face à l’instabilité des liaisons.
Validation en conditions réelles : le « stabilisateur » du supercalculateur
Le protocole MRC est déjà déployé dans le supercalculateur GB200 de NVIDIA et l'infrastructure cloud d'Oracle. Les données de test confirment que même lors de scénarios d'entraînement actifs, le MRC peut automatiquement contourner les perturbations — telles que la gigue soudaine des liaisons ou les redémarrages de commutateurs —, garantissant ainsi la poursuite sans interruption des tâches d'entraînement complexes.
Article connexe
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss
Recommandations de sujets spéciaux liés
commentaires (0)
OpenAI a officiellement annoncé une collaboration avec cinq leaders du secteur — AMD, Broadcom, Intel, Microsoft et NVIDIA — en vue du lancement du protocole MRC (Multipath Reliable Connection). Ce protocole open source, publié dans le cadre de l'Open Compute Project (OCP), est conçu pour remédier aux problèmes de latence et aux pannes réseau fréquemment rencontrés lors de l'entraînement de l'IA à grande échelle.

Éliminer le « point de défaillance unique » : passer d'une architecture à trois niveaux à une architecture à deux niveaux
Dans l'entraînement traditionnel des modèles d'IA, la congestion du réseau ou une défaillance mineure sur une seule liaison peut se propager en cascade, comme des dominos, forçant des dizaines de milliers de GPU à passer en état d'inactivité et entraînant un gaspillage informatique considérable.
Afin d’améliorer fondamentalement la résilience du système, le protocole MRC introduit une conception de réseau multiplan. Il divise intelligemment une interface unique de 800 Gb/s en plusieurs liaisons plus petites. Cette optimisation structurelle permet au système de prendre en charge des clusters massifs comptant jusqu’à environ 131 000 GPU en utilisant seulement deux couches de commutation. Par rapport aux architectures traditionnelles à deux ou quatre niveaux, cette évolution réduit non seulement de manière drastique le nombre de composants physiques et la consommation d'énergie, mais diminue également considérablement les coûts de construction.
Gestion avancée du trafic : « pulvérisation » de paquets et récupération à l'échelle de la microseconde
Au-delà de la simplification architecturale, le MRC introduit une approche novatrice de la distribution du trafic. Il utilise une technologie de « pulvérisation » adaptative des paquets, s'éloignant de la transmission traditionnelle à chemin unique. Cette méthode décompose les paquets de tâches et les distribue sur des centaines de chemins parallèles. Même si les paquets arrivent dans le désordre, le récepteur peut les réassembler avec précision, empêchant ainsi efficacement la congestion localisée au sein du réseau central.
Pour le contrôle du réseau, le MRC remplace les protocoles de routage dynamique complexes (tels que le BGP) par la technologie de routage par source SRv6. Cela permet à l’expéditeur de spécifier directement le chemin, tandis que les commutateurs n’effectuent qu’un simple transfert statique. Cette conception réduit le temps de récupération en cas de défaillance du réseau de quelques secondes à quelques microsecondes, permettant au système d’atteindre une « auto-réparation quasi transparente » face à l’instabilité des liaisons.
Validation en conditions réelles : le « stabilisateur » du supercalculateur
Le protocole MRC est déjà déployé dans le supercalculateur GB200 de NVIDIA et l'infrastructure cloud d'Oracle. Les données de test confirment que même lors de scénarios d'entraînement actifs, le MRC peut automatiquement contourner les perturbations — telles que la gigue soudaine des liaisons ou les redémarrages de commutateurs —, garantissant ainsi la poursuite sans interruption des tâches d'entraînement complexes.
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
La Corée du Sud pose la première pierre du centre national de calcul en intelligence artificielle, investissant 2,5 billions de wons avec un objectif pour 2028
Le journal sud-coréen EtNews rapporte que la cérémonie de pose de la première pierre du Centre de calcul IA de Corée (KOACC) s’est tenue le 3 août au parc de centres de données Solar City à Sunan, dans la province du Jeollanam-do. Doté d’un investiss











