NVIDIA Mellanox 920-9B110-00FH-0D0 dans la pratique: optimisation des tissus RDMA à faible latence pour les grappes HPC et IA
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 dans la pratique: optimisation des tissus RDMA à faible latence pour les grappes HPC et IA
Contexte et défi: quand la performance HDR correspond à la réalité budgétaire
Un laboratoire de recherche sur l'IA de taille moyenne a récemment fait face à un défi familier: leur tissu EDR InfiniBand de 100 Gb/s était en train de devenir un goulot d'étranglement pour leur grappeur GPU en expansion,qui est passé de 128 à 512 nœuds NVIDIA A100- les temps de formation des modèles de transformateurs à grande échelle ont augmenté de plus de 40% en raison de la congestion du réseau pendant les opérations de réduction totale,et l'équipe avait besoin d'une mise à niveau qui pourrait offrir des gains de performance substantiels sans les dépenses en capital nécessaires pour un déploiement complet de NDR de 400 Gb/s.
Le laboratoire a évalué plusieurs options et a identifié le HDR 200Gb/s comme l'équilibre idéal entre performance et coût.contrôle avancé de la congestion, et une intégration transparente avec leurs câbles et émetteurs-récepteurs compatibles HDR existants.NVIDIA Mellanox 920-9B110-00FH-0D0Dans le cas de la technologie HDR, le débit de la bande passante est supérieur à celui de la bande passante HDR.
Solution et déploiement: un tissu HDR optimisé en termes de coûts
Le laboratoire a déployé le920-9B110-00FH-0D0 InfiniBand commutateur OPNChaque rack de calcul a reçu un commutateur basé sur le MQM8790-HS2F, la plateforme de silicium sous-jacente à l'appareil.920-9B110-00FH-0D0 MQM8790-HS2F 200 Gb/s HDR¢ fournir 40 ports de connectivité de 200 Gb/s aux serveurs GPU via des câbles de raccordement direct OSFP-OSFP.la création d'un tissu à base d'arbre gras non bloquant avec une bande passante de bisection complète.
Ce qui a rendu ce déploiement particulièrement efficace, c'est la technologie SHARPv2 intégrée au commutateur (Scalable Hierarchical Aggregation and Reduction Protocol),qui a déchargé les opérations de communication collective directement sur le tissu de commutationDans la pratique, cela signifiait que les opérations all-reducer, qui consommaient auparavant des cycles de processeur hôte et une bande passante réseau importants,Ces travaux étaient désormais réalisés en un seul passage à travers le tissu, ce qui réduisait considérablement les délais de réalisation des travaux..
Selon leLes données de l'établissement doivent être fournies à l'autorité compétente de l'État membre où le véhicule est situé.L'équipe d'ingénieurs a également confirmé que le détecteur de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs de détecteurs.Les données de l'établissement doivent être disponibles sur le site Web de l'établissement.L'écosystème comprenait tous les types de câbles et les optiques sur lesquels ils avaient déjà normalisé, éliminant ainsi le besoin d'efforts de recâblage coûteux.
Résultats et gains mesurables: du goulot d'étranglement à l'activation
Après le déploiement, le laboratoire a mesuré les améliorations à travers plusieurs dimensions critiques:
- Réduction du temps de réalisation des travaux:Les itérations d'entraînement pour un modèle de paramètre 13B ont diminué de 35%, la latence de réduction totale passant de 12 μs à moins de 5 μs pour les tailles collectives typiques.
- Utilisation du réseau:L'utilisation moyenne du tissu est passée de 58% à 83% sans provoquer de congestion, grâce aux mécanismes de routage et de contrôle de la congestion adaptatifs de l'interrupteur.
- Efficacité énergétique et de refroidissement:Comparé au tissu EDR précédent, la nouvelle infrastructure HDR a réduit la consommation d'énergie par port de 30%, permettant au laboratoire d'ajouter plus de nœuds de calcul sans dépasser son budget d'alimentation du centre de données.
D'un point de vue du coût total de la propriété,920-9B110-00FH-0D0 prixLes résultats de l'étude ont montré que les coûts de production de la technologie de la RND par port étaient nettement inférieurs à ceux des alternatives de RND, ce qui a permis au laboratoire de mettre à niveau l'ensemble de son tissu dans le cadre de son budget existant.Les spécifications 920-9B110-00FH-0D0Il a également mis en évidence les deux sources d'alimentation redondantes de l'interrupteur et les modules de ventilateur interchangeables à chaud, qui ont contribué à l'objectif du laboratoire de 99,999% de disponibilité pour leurs emplois de formation en production.
Les ingénieurs de réseau ont noté que le920-9B110-00FH-0D0 InfiniBand commutateur OPN solutionintégré de manière transparente au gestionnaire de tissus unifié (UFM) de NVIDIA, offrant une visibilité centralisée sur l'état du tissu et une alerte automatisée.Cela a considérablement réduit le temps consacré au dépannage et à la maintenance proactive, libérant l'équipe pour se concentrer sur l'optimisation de leurs pipelines de formation plutôt que sur la gestion du réseau.
Résumé & Perspectives: La Fondation HDR de taille appropriée
LeNVIDIA Mellanox 920-9B110-00FH-0D0Il s'est avéré être le bon choix pour ce laboratoire de recherche, offrant les performances de 200 Gb/s HDR à une structure de coût qui avait du sens.capacités de calcul en réseau, et des fonctionnalités de gestion robustes, le laboratoire a transformé son réseau d'un goulot d'étranglement de performance en une base évolutive pour une croissance future.
En vue de l'avenir, le laboratoire prévoit d'étendre leur grappe à 1 024 nœuds au cours des 18 prochains mois.Ils ont confiance que leur réseau peut croître avec leur capacité de calcul.Pour les organisations qui évaluent leurs options d'infrastructure HDR, le920-9B110-00FH-0D0 à vendreNVIDIA propose une solution convaincante, validée par la production, qui équilibre performance, densité et coût.

