NVIDIA Mellanox 920-9B210-00FN-0D0 dans la pratique: Construire un tissu NDR à faible latence pour les modèles MoE à paramètres de trillions
August 27, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 dans la pratique: Construire un tissu NDR à faible latence pour les modèles MoE à paramètres de trillions
Le contexte et le défi: Quand le tout-à-tout devient le goulot d'étranglement de la formation
Une importante organisation de recherche sur l'IA a récemment augmenté son groupe de formation de modèles de langage de 1024 à 4096 GPU NVIDIA H100, avec l'objectif ambitieux de réduire le temps de formation pour un 1.Modèle MoE (Mixture of Experts) de 8 billions de paramètres, de mois à moins de deux semainesCependant, lors de la validation initiale, the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%, bien en dessous du seuil nécessaire pour respecter le délai de formation.
L'analyse du réseau a révélé que la communication collective tout-à-tout représentait plus de 40% de l'empreinte de communication du modèle du Ministère de l'Éducation et de la Santé.Le trafic est devenu de plus en plus fragmenté et débordé.Le réseau HDR existant, après avoir déclenché les mécanismes de contrôle de la congestion, a connu des augmentations spectaculaires de la latence de la queue, laissant une partie significative des GPU inactifs et en attente.L'organisation avait besoin d'urgence d'un tissu de réseau capable de fournir une latence déterministe sous-microseconde, le transport sans perte, et l'évolutivité massive sans blocageNVIDIA Mellanox 920-9B210-00FN-0D0a été spécialement conçu pour ce défi.
Solution et déploiement: une architecture de feuille-colonne vertébrale NDR optimisée pour le MoE
L'organisation a déployé un tissu à deux couches de feuilles-colonne vertébrale construit autour de la920-9B210-00FN-0D0 InfiniBand commutateur OPNDans chaque rack, deuxLe système de détection de la pollution par le gaz est utilisé pour la détection de la pollution par le gaz.Des commutateurs ont été déployés à la couche feuille, fournissant une connectivité de 400 Gb/s à 64 serveurs H100 à double port via des câbles optiques actifs OSFP-OSFP.16 commutateurs supplémentaires 920-9B210-00FN-0D0 interconnectés, la création d'un tissu de fat-tree entièrement non-bloquant avec une bande passante de bisection globale de 51,2 Tb/s.
La pièce maîtresse de cette solution est la technologie SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) intégrée au commutateur.la communication tout-à-tout a été déchargée directement sur le tissu de commutation, avec les commutateurs effectuant la réduction et la redistribution des données en réseau.réduire considérablement les frais généraux de communication qui avaient affecté le déploiement HDR précédent. LeLe nombre de points de contrôle doit être le même que le nombre de points de contrôle.met en évidence la latence de coupure inférieure à 100 ns, qui a été validée au cours de la phase de preuve de concept et s'est avérée critique pour les exigences strictes de latence de la charge de travail du ministère de l'Énergie.
LeLes spécifications 920-9B210-00FN-0D0L'équipe d'ingénieurs a également confirmé que le système d'alimentation de base, qui comprend des sources d'alimentation à double redondance et des ventilateurs échangeables à chaud, a donné à l'équipe la confiance nécessaire pour atteindre son objectif de disponibilité de 99,999%.920-9B210-00FN-0D0 est compatibleL'écosystème comprenait toutes les optiques et câbles OSFP qu'ils avaient déjà qualifiés, éliminant les retards d'approvisionnement et simplifiant le calendrier de déploiement.
Résultats et gains mesurables: du goulot d'étranglement à l'activation
Après le déploiement complet du tissu NDR et le redémarrage du travail de formation du Ministère de l'Énergie, l'organisation a mesuré les améliorations transformatrices à travers plusieurs dimensions:
- Récupération de l'utilisation du GPU:L'utilisation moyenne des GPU est passée de 52% à 89%, avec une utilisation maximale atteignant 94% pendant les phases de calcul intensif, résultat direct de l'élimination des arrêts induits par le réseau.
- Réduction de la latence tout-à-tout:Le temps requis pour un échange complet tout-à-tout sur 4 096 GPU est passé de 180 ms à moins de 45 ms, une amélioration de 75% qui se traduit directement par des itérations de formation plus rapides.
- Temps de réalisation du travail:Le calendrier de formation prévu pour le modèle MoE de 1,8 T a été réduit de 14 jours à seulement 9 jours - une accélération de 36% qui a considérablement réduit les coûts de mise sur le marché et de calcul en nuage.
- Efficacité opérationnelle:Avec 64 ports par commutateur, le nombre de commutateurs de colonne vertébrale requis a été réduit de 37% par rapport à une conception HDR à 40 ports, simplifiant le câblage et réduisant la consommation d'énergie par rack de 28%.
D'un point de vue du coût total de la propriété, l'équipe financière de l'organisation a noté que, bien que920-9B210-00FN-0D0 prixLe coût de mise en réseau par GPU a en fait diminué en raison de la radix plus élevée et du nombre réduit de couches de commutation.combiné avec les gains spectaculaires de performance, la mise à niveau de la NDR a été une victoire commerciale évidente.920-9B210-00FN-0D0 InfiniBand commutateur OPN solutionIls ont également intégré de manière transparente leur déploiement NVIDIA UFM existant, offrant une visibilité centralisée et des alertes automatisées qui ont réduit les frais généraux opérationnels de 40%.
Résumé & Perspectives: La Fondation NDR pour les charges de travail du ministère de l'Énergie de nouvelle génération
LeNVIDIA Mellanox 920-9B210-00FN-0D0s'est avéré être la solution transformatrice dont cette organisation de recherche sur l'IA avait besoin pour libérer tout le potentiel de son cluster H100 de 4096 GPU.et SHARPv3 en réseau, le changement leur a permis de passer de 1024 à 4 096 GPU sans compromettre les performances ou la gestion, un exploit qui aurait été impossible avec leur infrastructure HDR précédente.
Dans l'avenir, l'organisation prévoit de s'étendre à 8192 GPU dans les 18 prochains mois, en tirant parti de la920-9B210-00FN-0D0 à vendrePour les organisations qui évaluent leurs investissements en IA et en réseaux HPC de nouvelle génération,le 920-9B210-00FN-0D0 offre une, une solution prête à la production qui tient sa promesse d'optimisation des interconnexions RDMA à faible latence à exascale.

