NVIDIA Mellanox MQM9790-NS2F en action : Construire une fabric RDMA à faible latence pour les clusters d'IA et de HPC

August 24, 2026

Dernières nouvelles de l'entreprise NVIDIA Mellanox MQM9790-NS2F en action : Construire une fabric RDMA à faible latence pour les clusters d'IA et de HPC

NVIDIA Mellanox MQM9790-NS2F en action: Construire un tissu RDMA à faible latence pour les grappes IA et HPC

Le contexte et le défi: quand l'expansion devient un goulot d'étranglement

Comme les grands modèles de langage évoluent de milliers à des dizaines de milliers de GPU, et les simulations météorologiques poussent vers une résolution à l'échelle du kilomètre,les limites des tissus Ethernet traditionnels deviennent évidentesDans ces environnements, les modèles de communication collective MPI, tels que "tout réduire" et "tout pour tous", imposent des exigences extrêmes en matière de latence du réseau et de contrôle de la congestion.Même les nœuds de calcul les plus puissants passent une partie importante de leurs cycles à attendre des données, gaspillant efficacement des ressources GPU coûteuses.

C'est précisément le défi queNVIDIA Mellanox MQM9790-NS2F est un appareil de téléphonie mobile.En tant que commutateur NDR InfiniBand de 400 Gb/s avec 64 ports OSFP, il est conçu pour fournir une latence déterministe de moins d'une microseconde sur des milliers de terminaux,permettant une véritable mise à l'échelle linéaire pour les charges de travail distribuées.

Solution et déploiement: un tissu de feuille-colonne vertébrale construit pour RDMA

Dans un scénario de déploiement typique pour un grand laboratoire de recherche sur l'IA, leMQM9790-NS2F Commutateur InfiniBandforme le noyau d'une topologie à deux niveaux feuille-colonne vertébrale. à la couche feuille, chaque rack de calcul est équipé d'une ou deux unités MQM9790-NS2F,fournissant 64 ports de connectivité de 400 Gb/s aux serveurs GPU via des câbles en cuivre à raccordement direct OSFP-OSFP ou des câbles optiques actifsÀ la couche de la colonne vertébrale, des commutateurs MQM9790-NS2F supplémentaires relient les feuilles, créant un tissu de fat-tree non-bloquant avec une bande passante de bisection complète.

What makes this solution particularly compelling is the switch's native support for RDMA over Converged Ethernet (RoCE) when operating in InfiniBand mode—though here it leverages InfiniBand's native RDMA capabilities for even lower latency and CPU offload. LeMQM9790-NS2F 400Gb/s NDR OSFP à 64 portsintégre la technologie SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) de NVIDIA, qui décharge les opérations collectives directement sur le tissu de commutation.Cela signifie qu'une opération de réduction totale qui traverserait normalement le réseau plusieurs fois est maintenant terminée en une seule passe., réduisant les délais d'achèvement des tâches jusqu'à 30% pour les charges de travail à forte intensité de communication.

Pour les architectes de réseaux évaluant lesMQM9790-NS2F Solution de commutateur InfiniBand, le processus de déploiement est rationalisé par le gestionnaire de tissu unifié (UFM) de NVIDIA.La gestion des tissus avec plus de 2Les premiers utilisateurs ont signalé que laCompatible avec le MQM9790-NS2FL'écosystème, qui comprend une large gamme de câbles et émetteurs-récepteurs certifiés NVIDIA, simplifie l'approvisionnement et réduit les risques de déploiement.

Résultats et gains mesurables: de la théorie à la réalité de la production

Dans un récent déploiement de production d'un groupe de 2.048 GPU dédié à la formation de modèles de transformateurs à grande échelle, la mise à niveau de l'infrastructure HDR (200 Gb/s) vers NDR (400 Gb/s)NVIDIA Mellanox MQM9790-NS2F est un appareil de téléphonie mobile.Au cœur de cette démarche, il y a eu des améliorations mesurables à travers de multiples dimensions:

  • Réduction du temps de réalisation des travaux:Les itérations d'entraînement de bout en bout pour un modèle de paramètre 175B ont diminué de 28%, en grande partie en raison du déchargement de SHARPv3 et de la latence réduite de la queue.
  • Utilisation du réseau:L'utilisation moyenne du tissu est passée de 62% à 89% sans provoquer l'effondrement de la congestion, grâce aux mécanismes avancés de routage adaptatif et de contrôle de la congestion de l'interrupteur.
  • Simplicité de fonctionnement:Avec 64 ports par commutateur, le nombre de commutateurs de colonne vertébrale requis a été réduit de moitié par rapport à une conception HDR à 32 ports, réduisant considérablement la complexité du câblage et la consommation d'énergie par rack.

Selon leLes spécifications MQM9790-NS2F, le commutateur offre une latence port-à-port inférieure à 100 ns et prend en charge jusqu'à 51,2 Tb/s de capacité de commutation globale.Les ingénieurs de réseau ont également noté que leFiche de données MQM9790-NS2FLes résultats obtenus par le personnel de l'établissement doivent refléter avec précision les performances du monde réel, sans surprises pendant la phase de validation.

D'un point de vue TCO, la capacité de consolider plus de terminaux par niveau de commutation a directement réduit les dépenses en capital.Le prix MQM9790-NS2FLes coûts de mise en réseau par GPU ont en fait diminué en raison du radix plus élevé et du nombre réduit de couches de commutation.combiné avec les gains de performance, a rendu l'affaire claire pour le comité directeur du laboratoire.

Résumé & Perspectives: La Fondation NDR pour l'informatique à échelle exascale

LeNVIDIA Mellanox MQM9790-NS2F est un appareil de téléphonie mobile.Il s'agit d'un changement fondamental dans la façon dont les grappes HPC et AI sont conçues.et l'accélération de calcul en réseau dans un facteur de forme unique de 1U, il permet aux architectes de construire des tissus qui évoluent vers des dizaines de milliers de terminaisons sans sacrifier les performances ou la gestion.

À l'avenir, alors que les charges de travail continuent à exiger une bande passante plus élevée et une latence plus faible, laMQM9790-NS2F Commutateur InfiniBandIl servira de base à la prochaine génération de systèmes exascale.Sa compatibilité avec les plates-formes NVIDIA Quantum-2 existantes et son intégration transparente avec UFM assurent une migration en douceur pour les organisations qui passent d'une plateforme HDR à une autre.Pour les responsables informatiques et les architectes qui évaluent leurs investissements en réseaux de nouvelle génération, le MQM9790-NS2F offre unune solution prête à la production qui réalise la promesse d'optimisation des interconnexions RDMA à faible latence.