NVIDIA Mellanox MQM8790-HS2F Commutateur InfiniBand en action: Optimisation de l'interconnexion à faible latence pour les grappes RDMA / HPC / AI

August 21, 2026

Dernières nouvelles de l'entreprise NVIDIA Mellanox MQM8790-HS2F Commutateur InfiniBand en action: Optimisation de l'interconnexion à faible latence pour les grappes RDMA / HPC / AI

NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch en action : Optimisation de l'interconnexion à faible latence pour les clusters RDMA/HPC/IA

Dans le domaine de l'entraînement de modèles d'IA à grande échelle et du calcul haute performance (HPC), la latence réseau devient souvent le goulot d'étranglement critique qui limite la scalabilité et l'efficacité du cluster. Un centre de supercalcul de niveau national a récemment achevé une mise à niveau majeure de son infrastructure, passant d'une fabric InfiniBand EDR de 100 Gb/s à une solution HDR de 200 Gb/s construite autour du commutateur InfiniBand NVIDIA Mellanox MQM8790-HS2F. Cette étude de cas examine les défis rencontrés, la stratégie de déploiement et les gains de performance mesurables obtenus grâce à cette interconnexion de nouvelle génération.

Contexte et défis : Quand la latence devient le plafond de performance

Le centre de supercalcul exploite un cluster hétérogène comprenant plus de 2 000 nœuds GPU, prenant en charge un mélange diversifié de charges de travail incluant la simulation météorologique, la recherche génomique et l'entraînement de grands modèles linguistiques. Avec le réseau EDR précédent de 100 Gb/s, l'équipe d'exploitation a observé que les opérations de communication collective — telles que all-reduce et all-gather — consommaient une part croissante du temps d'exécution total des tâches à mesure que le nombre de nœuds augmentait. Dans certaines tâches d'entraînement distribué, la surcharge liée au réseau représentait près de 40 % du temps d'exécution de bout en bout, limitant sévèrement l'utilisation des GPU et prolongeant les cycles de convergence des modèles.

Les défis supplémentaires comprenaient :

  • Points chauds de congestion : Les modèles de trafic dans l'entraînement de l'IA sont souvent intermittents et imprévisibles, entraînant un blocage en tête de ligne et des pics de latence en queue qui perturbaient la planification des tâches.
  • Accélération insuffisante dans le réseau : La fabric héritée ne prenait pas en charge les capacités avancées de déchargement collectif, obligeant toutes les opérations de réduction à traverser le CPU hôte et la hiérarchie mémoire.
  • Complexité de la gestion : Le dépannage des problèmes de performance nécessitait une analyse manuelle de plusieurs outils de surveillance, rendant difficile l'identification des causes profondes dans les déploiements à grande échelle.

Après avoir évalué plusieurs options d'interconnexion, le centre a sélectionné le MQM8790-HS2F comme base de sa nouvelle fabric. Selon la fiche technique du MQM8790-HS2F, ce commutateur offre 40 ports de débit non bloquant HDR de 200 Gb/s, une latence de coupe inférieure à 130 ns et la prise en charge du déchargement collectif SHARP v3.0 — des capacités qui répondaient directement à leurs principaux points faibles.

Solution et déploiement : Construction d'une fabric à faible latence pour l'IA/HPC

Le déploiement a adopté une topologie fat-tree à deux niveaux, avec 24 commutateurs MQM8790-HS2F 200Gb/s HDR 40-port QSFP56 déployés comme nœuds feuilles et 8 unités comme commutateurs spine. Cette configuration a fourni une sursouscription de 2:1 sur l'ensemble du cluster — suffisante pour leur charge de travail actuelle tout en permettant une marge pour une expansion future.

Couche de déploiement Nombre de commutateurs Ports utilisés Connectivité
Feuille (par rack) 24 32 ports chacun Serveurs ToR + liaisons montantes spine
Spine 8 36 ports chacun Maillage complet vers tous les commutateurs feuilles

Chaque commutateur feuille se connecte aux nœuds de calcul via des cartes hôtes NVIDIA ConnectX-6 HDR. L'écosystème d'optiques et de câblage compatible MQM8790-HS2F a permis à l'équipe de réutiliser les câbles QSFP56 existants, accélérant le déploiement et réduisant les coûts d'approvisionnement. L'installation physique complète a été réalisée en deux semaines, le plan de contrôle s'appuyant sur le Unified Fabric Manager (UFM) de NVIDIA pour la découverte automatique de la topologie et le provisionnement.

La prise en charge du commutateur pour le routage adaptatif et le contrôle de la congestion s'est avérée essentielle pour gérer le trafic intermittent caractéristique des charges de travail d'IA. En redistribuant dynamiquement les flux sur les chemins disponibles, le commutateur InfiniBand MQM8790-HS2F a minimisé la formation de points chauds et maintenu des performances constantes, même pendant les périodes de pointe de planification des tâches.

Résultats et gains : Améliorations mesurables du débit des tâches et de l'utilisation des GPU

Après trois mois d'exploitation en production, le centre de supercalcul a signalé des gains de performance significatifs sur plusieurs dimensions :

  • Réduction de la latence : La latence moyenne MPI ping-pong est passée de 680 ns sur la fabric EDR précédente à moins de 130 ns avec le NVIDIA Mellanox MQM8790-HS2F, ce qui représente une amélioration de 5 fois de l'efficacité de l'échange de messages.
  • Accélération des opérations collectives : La latence all-reduce pour les tâches de 1024 nœuds a diminué de 62 %, grâce au déchargement SHARP v3.0 qui effectue les opérations de réduction directement dans la fabric du commutateur.
  • Utilisation des GPU : L'effet combiné de la latence réduite et de la bande passante accrue a fait passer l'utilisation moyenne des GPU de 72 % à 91 %, ce qui se traduit par une réduction de 26 % du temps de résolution pour les entraînements de grands modèles linguistiques.
  • Efficacité de la planification des tâches : La réduction de la variance de la latence en queue a permis au planificateur SLURM de charger plus de tâches sur le même ensemble de nœuds sans interférence de performance, augmentant le débit global du cluster d'environ 18 %.

Lorsque l'équipe a ensuite comparé le prix du MQM8790-HS2F aux commutateurs alternatifs d'autres fournisseurs, elle a constaté que le coût total par Gb/s livré était très compétitif — surtout en tenant compte de la réduction des frais de gestion et de la capacité du commutateur à prendre en charge les vitesses de liaison HDR et HDR100, protégeant ainsi les investissements dans les environnements à vitesses mixtes.

D'un point de vue opérationnel, la plateforme UFM intégrée a fourni une interface unique pour surveiller la santé de la fabric, les modèles de trafic et les erreurs au niveau des liens. Cette visibilité a permis à l'équipe d'identifier de manière proactive les câbles dégradés et de les remplacer lors de la maintenance planifiée, évitant ainsi les temps d'arrêt imprévus.

Résumé et perspectives : Un modèle pour les fabrics à faible latence de nouvelle génération

Cette étude de cas démontre que la solution de commutateur InfiniBand MQM8790-HS2F est plus qu'une simple mise à niveau de vitesse — c'est un composant transformateur pour les organisations cherchant à libérer tout le potentiel de performance de leur infrastructure d'IA et de HPC. En combinant une densité de ports élevée, une latence ultra-faible et des capacités de calcul dans le réseau, le commutateur s'attaque directement aux goulots d'étranglement de communication qui ont historiquement limité la scalabilité des clusters.

À l'avenir, le centre de supercalcul prévoit d'étendre sa fabric à 2 400 nœuds au cours du prochain exercice financier, en s'appuyant sur la même architecture MQM8790-HS2F avec des commutateurs spine supplémentaires. L'équipe explore également la prise en charge par le commutateur des algorithmes de réduction améliorés de SHARP v3.0, qui promettent d'accélérer davantage les charges de travail émergentes telles que les réseaux neuronaux graphiques et l'apprentissage par renforcement.

Pour les responsables informatiques, les architectes réseau et les ingénieurs évaluant les options d'interconnexion pour leurs propres constructions de clusters, le NVIDIA Mellanox MQM8790-HS2F offre une voie éprouvée et validée sur le terrain pour atteindre une latence sub-microseconde, une utilisation maximale des GPU et une gestion simplifiée de la fabric. Des spécifications détaillées du MQM8790-HS2F et des conceptions de référence sont disponibles sur le portail de documentation technique de NVIDIA, et le commutateur est désormais largement disponible — recherchez MQM8790-HS2F à vendre pour trouver un partenaire régional.