Solution technique du commutateur InfiniBand Mellanox (NVIDIA Mellanox) MQM9790-NS2F
July 13, 2026
Mellanox (NVIDIA Mellanox) Solution technique de commutateur InfiniBand MQM9790-NS2F – Optimisation d'interconnexion à faible latence pour les clusters RDMA/HPC/AI
Ce livre blanc technique présente une architecture de solution complète centrée surMellanox (NVIDIA Mellanox) MQM9790-NS2FCommutateur InfiniBand. Destiné aux architectes réseau, aux ingénieurs avant-vente et aux responsables des opérations, le document détaille comment leMQM9790-NS2Foffre une latence déterministe ultra faible, un RDMA sans perte et une bande passante évolutive pour les infrastructures HPC et IA de nouvelle génération. Nous couvrons les principes de conception, les topologies de déploiement, les meilleures pratiques opérationnelles et la validation des performances.
1. Contexte du projet et analyse des exigences
Les charges de travail modernes de formation en IA et de simulation scientifique exigent des structures de réseau capables de supporter des modèles de communication massifs de réduction, de collecte et de point à point avec une gigue inférieure à la microseconde. Les solutions Ethernet traditionnelles, même avec RoCEv2, introduisent de la complexité dans la gestion de la congestion, le réglage du PFC et le contrôle de la latence finale, conduisant souvent à une utilisation inefficace du GPU et à des délais d'exécution des tâches imprévisibles.
Les principales exigences identifiées dans les projets HPC/IA typiques comprennent :
- Latence de bout en bout < 1 μs (commutateur port à port) à pleine charge
- Tissu sans perte avec zéro perte de paquets due à la congestion
- Évolutivité de 64 à plus de 2 000 nœuds GPU sans modifications architecturales
- Opérations simplifiées avec une télémétrie riche et une récupération automatisée des pannes
LeNVIDIA Mellanox MQM9790-NS2Frépond directement à ces demandes en intégrant la technologie NDR 400 Gb/s, le routage adaptatif et l'informatique en réseau dans une plate-forme OSFP 1U à 64 ports.
2. Conception globale de l’architecture réseau/système
L'architecture recommandée adopte une topologie feuille-épine (ou gros arbre) à deux niveaux pour fournir une bande passante de bissection complète et une résilience élevée. Chaque bloc de feuilles comprend plusieurs racks, chaque rack abritant deuxCommutateurs InfiniBand MQM9790-NS2Fpour la redondance. La couche dorsale regroupe le trafic de tous les commutateurs feuilles, garantissant ainsi une communication non bloquante entre deux points de terminaison.
LeMQM9790-NS2F 400 Gb/s NDR OSFP 64 portsL'interrupteur sert à la fois de feuille et de colonne vertébrale, offrant un matériel uniforme sur tout le tissu, simplifiant ainsi le remplacement et la maintenance. Pour un cluster de 1 024 GPU, une conception typique utilise 16 commutateurs feuilles (chacun connectant 64 GPU) et 8 commutateurs spine, tous interconnectés via des câbles optiques ou DAC 400G. La structure prend en charge les topologies Fat Tree et Dragonfly+, avec un routage adaptatif équilibrant dynamiquement le trafic sur plusieurs chemins.
3. Rôle et principales caractéristiques duMellanox (NVIDIA Mellanox) MQM9790-NS2Fdans la solution
LeNVIDIA Mellanox MQM9790-NS2Fest la pierre angulaire de cette solution, offrant :
- 64 ports OSFPchacun fonctionnant à 400 Gbit/s (NDR) – capacité de commutation globale de 25,6 Tbit/s, avec une latence de coupure inférieure à 600 ns.
- Routage adaptatif– sélectionne dynamiquement le chemin le moins encombré par paquet, évitant ainsi les liens de points d'accès et maintenant une latence constante même dans des modèles de trafic asymétriques.
- SHARPv3 (Protocole d'agrégation et de réduction hiérarchique évolutif)– décharge la communication collective (réduction totale, diffusion) des processeurs hôtes, réduisant ainsi les discussions sur le réseau et accélérant la formation de l'IA jusqu'à 20 à 30 %.
- Informatique en réseau– prend en charge la réduction des données, la segmentation et même les opérations MPI à petite échelle directement sur le commutateur, libérant ainsi de précieuses ressources GPU pour le calcul.
- Télémétrie et gestion de la congestion– Surveillance avancée intégrée comprenant des compteurs par flux, des histogrammes d'occupation de la mémoire tampon et des mesures de latence au niveau du chemin, tous exportables via des API UFM ou REST.
Ces capacités permettent auSolution de commutation InfiniBand MQM9790-NS2Fpour offrir des performances déterministes à grande échelle, validées par des tests de référence internes et des déploiements clients. LeSpécifications du MQM9790-NS2Fincluent également la prise en charge des DAC passifs en cuivre et des modules optiques actifs, offrant une flexibilité pour des distances allant jusqu'à 100 m (avec optique 400G SR4) et au-delà.
4. Recommandations de déploiement et de mise à l'échelle (topologie typique)
Pour un nouveau déploiement, nous recommandons l’approche progressive suivante :
- Phase 1 – Pilote :Déployez 2 commutateurs à feuilles (chacunMQM9790-NS2F) et 2 commutateurs spine, connectant 128 GPU. Valider les performances par rapport auxFiche technique MQM9790-NS2Fparamètres.
- Phase 2 – Mise à l'échelle :Ajoutez des commutateurs feuilles par incréments de 2 par rack et des commutateurs spine si nécessaire pour maintenir un surabonnement ≤ 1:1. La densité de 64 ports permet à un seul commutateur d'héberger un rack complet de 64 nœuds GPU (si chaque nœud dispose d'une seule liaison montante 400G).
- Phase 3 – Multiplan :Pour les clusters dépassant 2 000 nœuds, implémentez plusieurs structures indépendantes (par exemple, plans 2× ou 4×) avec un équilibrage de charge basé sur les routes, en tirant parti de la prise en charge par le commutateur des voies virtuelles et des clés de partition.
Le câblage typique utilise des DAC OSFP-à-OSFP pour les connexions intra-rack (≤3 m) et des modules optiques OSFP-à-400G SR4 pour des distances de feuille de colonne vertébrale jusqu'à 100 m. LeCompatible MQM9790-NS2FLes émetteurs-récepteurs sont validés avec l'écosystème des fournisseurs optiques de NVIDIA, garantissant une interopérabilité transparente.
5. Opérations, surveillance, diagnostic des pannes et optimisation
Des opérations efficaces sont essentielles pour maintenir une faible latence en production. La solution s'intègre àNVIDIA UFM (gestionnaire de structure unifié), qui fournit :
- Tableau de bord en temps réel– bande passante par port, compteurs d’erreurs et cartes thermiques de congestion.
- Réoptimisation automatisée des chemins– lorsqu'une liaison se dégrade ou tombe en panne, UFM recalcule les itinéraires et reconfigure les tables de routage adaptatives sans intervention de l'opérateur.
- Télémétrie historique– stocke les données de latence et de flux pour l’analyse post-mortem et la planification des capacités.
Flux de travail de dépannage recommandé :
- Surveillez les trames de pause et les rejets par port : aucun rejet n'est attendu ; tout rejet indique une mauvaise configuration ou une optique défectueuse.
- Validez le fonctionnement de SHARPv3 via les statistiques collectives d'UFM – assurez-vous que les opérations de réduction sont déchargées.
- Utilisez des outils de diagnostic intégrés (par exemple,
ibdiagnet,ibstatus) pour vérifier l'intégrité de la liaison et l'intégrité du signal.
Pour l'optimisation, ajustez le seuil de l'algorithme de routage adaptatif (par exemple, l'intervalle de détection de charge) en fonction des modèles de charge de travail – leCommutateur InfiniBand MQM9790-NS2Fpermet un réglage fin via les interfaces de gestion. Les mises à jour régulières du micrologiciel (disponibles via le portail d'assistance de NVIDIA) incluent des améliorations de performances et des correctifs de sécurité.
6. Résumé et évaluation de la valeur
LeMellanox (NVIDIA Mellanox) MQM9790-NS2Foffre une base évolutive et hautes performances pour les clusters RDMA/HPC/AI. En combinant une vitesse NDR de 400 Gbit/s, une densité de 64 ports et une informatique intelligente en réseau, il élimine les goulots d'étranglement traditionnels et offre une évolutivité linéaire jusqu'à la classe exascale. La solution réduit le coût total de possession grâce à une consommation inférieure par port (≈1,5 W), un câblage simplifié et une réduction de la surcharge du processeur due aux déchargements SHARP.
Pour les organisations évaluant lePrix MQM9790-NS2F, l'investissement est justifié par des gains mesurables dans l'utilisation du GPU (souvent dépassant 90 % en production) et une réduction jusqu'à 40 % des délais d'exécution des tâches par rapport aux tissus RoCEv2. LeFiche technique MQM9790-NS2FetSpécifications du MQM9790-NS2Ffournissent des détails complets et les unités sont facilement disponibles (MQM9790-NS2F à vendrevia les canaux autorisés). De plus, la compatibilité du commutateur avec les adaptateurs NVIDIA existants garantit un chemin de migration fluide pour les utilisateurs déjà investis dans l'écosystème Mellanox.
En résumé, cette solution technique basée sur leCommutateur InfiniBand MQM9790-NS2Foffre une structure robuste et efficace sur le plan opérationnel qui répond aux exigences d’interconnexion à faible latence les plus exigeantes – une pierre angulaire de la prochaine génération de supercalcul IA.

