NVIDIA Mellanox MQM9790-NS2F Référence technique: Optimisation des interconnexions à faible latence pour les grappes RDMA/HPC/IA
August 24, 2026
Référence Technique NVIDIA Mellanox MQM9790-NS2F : Optimisation de l'interconnexion à faible latence pour les clusters RDMA/HPC/IA
1. Contexte du projet et analyse des exigences
Les charges de travail modernes d'entraînement d'IA et de simulation HPC se caractérisent par des modèles de communication intenses, de type « all-to-all », qui imposent des exigences extrêmes au tissu réseau sous-jacent. À mesure que les clusters de GPU dépassent 1 000 nœuds, l'approche traditionnelle consistant à s'appuyer sur Ethernet avec un contrôle de congestion basé sur logiciel s'avère insuffisante. Les exigences clés émergeant de ces environnements incluent :
- Latence ultra-faible et déterministe : Latence port-à-port inférieure à la microseconde pour minimiser les temps d'achèvement des tâches MPI.
- Tissu sans perte : Zéro perte de paquets en cas de congestion pour éviter l'« incast » TCP et l'effondrement des performances.
- Déchargement de calcul dans le réseau : Réduction de la charge du CPU hôte pour les opérations collectives (par exemple, all-reduce, broadcast).
- Topologie évolutive : Prise en charge des topologies fat-tree et dragonfly+ avec une bande passante de bissection complète jusqu'à des milliers de points d'extrémité.
Le NVIDIA Mellanox MQM9790-NS2F est conçu pour répondre à ces exigences en tant que commutateur InfiniBand NDR 400 Gb/s avec 64 ports OSFP, offrant la densité et les performances requises pour les déploiements de classe exascale.
2. Conception globale de l'architecture réseau
La solution proposée utilise une topologie leaf-spine à deux niveaux, qui offre un équilibre entre évolutivité, contrôle de la sursouscription et simplicité de câblage. Au niveau des feuilles (leaf), chaque rack de calcul abrite une ou deux unités MQM9790-NS2F InfiniBand switch, fournissant 64 ports de connectivité 400 Gb/s aux serveurs GPU. Au niveau des épines (spine), un second niveau de commutateurs MQM9790-NS2F interconnecte toutes les feuilles, créant un tissu non bloquant.
Pour les déploiements à grande échelle dépassant 2 000 nœuds GPU, une architecture folded-Clos à trois niveaux peut être adoptée, avec le MQM9790-NS2F 400Gb/s NDR 64-port OSFP servant à la fois de feuille et d'épine pour maintenir des performances constantes à tous les niveaux. Cette conception garantit que n'importe quel serveur peut communiquer avec n'importe quel autre serveur à la vitesse de la ligne, avec un maximum de trois sauts de commutateur.
Le tableau suivant résume les paramètres d'évolutivité typiques pour un tissu leaf-spine à 2 niveaux construit autour du MQM9790-NS2F :
| Composant | Spécification | Valeur |
|---|---|---|
| Commutateurs Leaf | MQM9790-NS2F par rack | 1 à 2 unités |
| Commutateurs Spine | MQM9790-NS2F | N/2 (où N = nombre de commutateurs Leaf) |
| Points d'extrémité max. | Serveurs GPU par tissu | Jusqu'à 4 096 |
| Bande passante de bissection | Non bloquant complet | 51,2 Tb/s par niveau Spine |
3. Rôle et caractéristiques clés du NVIDIA Mellanox MQM9790-NS2F
Dans cette architecture, le NVIDIA Mellanox MQM9790-NS2F sert de bloc de construction fondamental, offrant plusieurs capacités critiques :
- 400 Gb/s NDR par port : Chacun des 64 ports OSFP prend en charge 400 Gb/s bidirectionnels, avec correction d'erreurs directe (FEC) pour une connectivité fiable sur longue portée.
- SHARPv3 intégré (Scalable Hierarchical Aggregation and Reduction Protocol) : Décharge les opérations de communication collective des CPU hôtes, réduisant la latence des « all-reduce » MPI jusqu'à 40 % dans les tâches à grande échelle.
- Routage adaptatif et contrôle de la congestion : Réachemine dynamiquement le trafic pour éviter les points chauds, garantissant des performances prévisibles même sous des modèles de trafic adverses.
- Télémétrie avancée : Compteurs par flux et par port, ainsi que la surveillance de l'occupation des tampons, offrent une visibilité approfondie sur l'état du tissu.
Selon la fiche technique détaillée du MQM9790-NS2F, le commutateur offre une latence de coupe inférieure à 100 ns et prend en charge une capacité de commutation agrégée allant jusqu'à 51,2 Tb/s. Ces spécifications en font un choix idéal pour les déploiements à partir de zéro et les mises à niveau progressives de l'infrastructure HDR (200 Gb/s).
4. Recommandations de déploiement et d'évolutivité
Pour les organisations qui prévoient d'adopter la solution de commutateur InfiniBand MQM9790-NS2F, les directives de déploiement suivantes sont recommandées :
- Stratégie de câblage : Utiliser des câbles cuivre à connexion directe (DAC) OSFP-à-OSFP pour les connexions intra-rack (jusqu'à 3 m) et des câbles optiques actifs (AOC) ou des émetteurs-récepteurs optiques pour les liaisons inter-rack et spine-leaf (jusqu'à 100 m).
- Redondance : Déployer des alimentations doubles et des modules de ventilateur remplaçables à chaud. Connecter chaque alimentation à des PDU distinctes pour la tolérance aux pannes.
- Cohérence du firmware : S'assurer que tous les commutateurs exécutent la même version de firmware NVIDIA pour éviter les incompatibilités de fonctionnalités. Utiliser la fonction de mise à niveau automatique du firmware d'UFM pour les mises à jour progressives.
- Évolutivité : Pour les clusters dépassant 4 000 nœuds, envisager une topologie folded-Clos à trois niveaux ou dragonfly+ avec le routage adaptatif activé. L'écosystème compatible MQM9790-NS2F comprend une large gamme d'optiques et de câbles pour prendre en charge ces topologies.
Lors du calcul du coût total de possession, tenir compte du nombre réduit de niveaux de commutateurs et de la simplification du câblage par rapport aux alternatives à radix plus faible. Bien que le prix du MQM9790-NS2F par unité soit plus élevé que celui des commutateurs de génération précédente, le coût par port et le coût de mise en réseau par GPU sont considérablement plus bas dans les déploiements à grande échelle, ce qui en fait un choix rentable pour les projets Exascale.
5. Opérations, surveillance et dépannage
Une gestion efficace d'un tissu NDR nécessite un cadre complet de surveillance et de dépannage. Le Unified Fabric Manager (UFM) de NVIDIA fournit un point de contrôle unique pour l'ensemble du tissu basé sur le NVIDIA Mellanox MQM9790-NS2F, offrant :
- Visualisation de la topologie : Découverte automatique et représentation graphique de tous les commutateurs, liens et points d'extrémité.
- Tableaux de bord de performance : Vues en temps réel de l'utilisation des ports, des taux d'erreur et des indicateurs de congestion.
- Alertes proactives : Alarmes basées sur des seuils pour la dégradation des liens, les anomalies de température et les défaillances d'alimentation.
- Isolation des pannes : Flux de dépannage guidés qui identifient les câbles, les émetteurs-récepteurs ou les ports de commutateur défectueux.
Pour un dépannage avancé, les spécifications du MQM9790-NS2F incluent une surveillance détaillée des tampons et des statistiques au niveau des flux qui peuvent être exportées via l'API REST pour une intégration avec des piles de surveillance personnalisées. Les ingénieurs réseau doivent également utiliser les outils de diagnostic intégrés du commutateur, tels que les tests en boucle fermée et l'analyse du taux d'erreur binaire (BER), pour valider l'intégrité des liens avant de déployer des charges de travail de production.
Les problèmes courants rencontrés lors des premiers déploiements incluent un routage sous-optimal causé par des vitesses de liaison inégales ou des types de câbles incompatibles. L'activation du routage adaptatif et la vérification que tous les liens fonctionnent à 400 Gb/s (avec la FEC activée) résolvent la majorité des anomalies de performance. La solution de commutateur InfiniBand MQM9790-NS2F inclut également la prise en charge de la redondance du gestionnaire de sous-réseau, garantissant que la reconfiguration du tissu peut se produire sans intervention manuelle en cas de défaillance d'un nœud de gestion.
6. Résumé et évaluation de la valeur
Le MQM9790-NS2F représente une avancée significative dans la mise en réseau haute performance, offrant une bande passante NDR de 400 Gb/s, une densité de 64 ports et une accélération de calcul dans le réseau sur une seule plateforme 1U gérable. Pour les architectes et les ingénieurs concevant des clusters d'IA et de HPC, ce commutateur offre une voie éprouvée vers les performances exascale, permettant :
- Réduction jusqu'à 30 % des temps d'achèvement des tâches pour les charges de travail d'entraînement à grande échelle grâce au déchargement SHARPv3.
- TCO plus faible par rapport aux solutions alternatives, grâce à un radix plus élevé et à un nombre réduit de couches de commutateurs.
- Opérations simplifiées via l'intégration UFM et une télémétrie complète pour une gestion proactive des pannes.
- Évolutivité pérenne pour prendre en charge les interconnexions GPU et accélérateurs de nouvelle génération.
Pour les organisations évaluant le MQM9790-NS2F à vendre via le réseau de partenaires de NVIDIA, nous recommandons de consulter la fiche technique détaillée du MQM9790-NS2F et de collaborer avec un architecte de solutions certifié pour adapter le déploiement à vos exigences spécifiques de charge de travail et d'échelle. Le NVIDIA Mellanox MQM9790-NS2F est prêt dès maintenant à servir de dorsale d'interconnexion haute performance pour la prochaine décennie de découverte scientifique et d'innovation en IA.

