NVIDIA Mellanox MQM8790-HS2F Livre blanc technique sur les commutateurs InfiniBand

August 21, 2026

NVIDIA Mellanox MQM8790-HS2F Livre blanc technique sur les commutateurs InfiniBand

NVIDIA Mellanox MQM8790-HS2F Livre blanc technique sur les commutateurs InfiniBand: optimisation de l'interconnexion à faible latence pour les grappes RDMA / HPC / AI

Ce livre blanc technique est destiné aux architectes de réseau, ingénieurs de prévente et directeurs d'exploitation.NVIDIA Mellanox MQM8790-HS2F est une marque américaine de télévision.Le commutateur HDR InfiniBand de 200 Gb/s, fournissant une conception complète de solution pour l'optimisation des interconnexions à faible latence dans le calcul haute performance (HPC) accéléré par RDMA,et des grappes d'intelligence artificielle (IA)Le document couvre la conception de l'architecture, les technologies clés, les stratégies de déploiement et de mise à l'échelle, le suivi des opérations,L'évaluation de la valeur et de l'expérience offre un modèle reproductible pour l'infrastructure informatique à forte intensité de données de nouvelle génération.

1. Analyse des antécédents et des besoins du projet

Comme les paramètres des modèles d'IA atteignent des magnitudes à l'échelle de milliards et que les simulations HPC exigent une résolution toujours plus fine,le tissu de réseau sous-jacent est passé d'un composant de support à un déterminant de performance principalLes emplois de formation distribués, par exemple, peuvent consacrer 40 à 60% de leur temps de fonctionnement à des opérations de communication collective si l'interconnexion ne dispose pas de caractéristiques de bande passante et de latence suffisantes.Pour les équipes informatiques d'entreprise, ce qui se traduit directement par un délai de mise sur le marché plus long pour les initiatives d'IA et des investissements en GPU sous-utilisés.

Les exigences clés identifiées au moyen d'un large engagement des clients comprennent:

  • La latence est très faible et prévisible:Commutation sous-200ns pour le trafic MPI et RDMA, avec un minimum de jitter.
  • Débit non bloquant:Des performances soutenues de vitesse de ligne dans tous les ports simultanément, éliminant la formation de points chauds et la dégradation de la latence de la queue.
  • Comptabilité en réseau:Accélération matérielle pour les opérations collectives (all-reduce, broadcast, barrier) pour décharger les processeurs hôtes et réduire le mouvement des données.
  • Prise en charge de la topologie évolutive:Capacité à construire des topologies d'arbre gras, de torus ou de libellule + couvrant des centaines à des milliers de nœuds sans couches de commutateur excessives.
  • Gestion simplifiée:Surveillance unifiée du tissu, découverte automatisée de la topologie et détection proactive des défauts pour réduire les frais généraux opérationnels.

LeLes produits de la catégorie 1 doivent être présentés dans la catégorie 1 de la présente annexe.Le projet a été sélectionné comme le bloc de construction optimal pour cette architecture de solution, avec sonFiche de données MQM8790-HS2Fconfirmant 40 ports de 200 Gb/s HDR, une latence de coupure inférieure à 130 ns et une prise en charge des capacités de calcul en réseau SHARP v3.0 qui correspondent directement aux exigences ci-dessus.

2. Conception globale de l'architecture réseau / système

L'architecture proposée utilise une topologie d'arbre gras à deux niveaux pour les grappes jusqu'à 1200 nœuds, avec une option d'extension à trois niveaux pour des déploiements plus importants.Cette topologie équilibre les performances, le coût et la gestion, en fournissant une bande passante de bisection complète et une latence déterministe à travers le tissu.

Niveau Type de dispositif Nombre de ports (utilisés) Le rôle de la connectivité
La feuille Les produits de la catégorie 1 doivent être présentés dans la catégorie 1 de la présente annexe. 32 x 200 Gb/s (16 pour les nœuds, 16 pour les spines) Les agrégats calculent le trafic des nœuds
La colonne vertébrale Les produits de la catégorie 1 doivent être présentés dans la catégorie 1 de la présente annexe. 40 x 200 Gb/s (tous sur les commutateurs à feuilles) Connexion croisée non bloquante entre feuilles

Chaque commutateur de feuille connecte jusqu'à 16 nœuds de calcul via NVIDIA ConnectX-6 ou ConnectX-7 HDR adaptateurs de canaux hôtes, en utilisant leMQM8790-HS2F est compatibleL'écosystème optique comprend à la fois les câbles optiques actifs (AOC) et les DAC en cuivre passif, selon la distance de liaison.MQM8790-HS2F 200Gb/s HDR à 40 ports QSFP56La conception fournit une densité suffisante pour l'agrégation au niveau du rack tout en maintenant un facteur de forme 1U pour une utilisation efficace de l'espace du rack.

Pour les clusters de plus de 1 200 nœuds, une topologie à trois niveaux avec une couche super-spine supplémentaire est recommandée.MQM8790-HS2F Solution de commutateur InfiniBandconserve son rôle à tous les niveaux, simplifiant la gestion de l'épargne et de la configuration, un seul type d'interrupteur prend en charge l'ensemble du tissu, du bord au cœur.

3Rôle et caractéristiques clés du NVIDIA Mellanox MQM8790-HS2F

LeNVIDIA Mellanox MQM8790-HS2F est une marque américaine de télévision.sert d'élément de commutation fondamental dans cette architecture, offrant les capacités de différenciation suivantes qui stimulent directement l'optimisation des interconnexions à faible latence:

  • Velocité du port HDR de 200 Gb/s:Double la bande passante de la génération précédente EDR (100 Gb/s) tout en maintenant la compatibilité avec HDR100 (100 Gb/s) pour les environnements à vitesse mixte, protégeant les investissements antérieurs.
  • Commutation par coupure avec une latence inférieure à 130ns:Minimise le temps que les paquets passent dans le commutateur, ce qui est essentiel pour les opérations RDMA sensibles à la latence et les modèles de communication collective.
  • SHARP v3.0 en réseau:Décharge les opérations de réduction des processeurs hôtes sur le tissu de commutation, réduisant le trafic de données jusqu'à 30% et accélérant les performances de toute réduction pour la formation de l'IA jusqu'à 2 fois.
  • Routage adaptatif et contrôle de la congestion:Distribue dynamiquement le trafic sur plusieurs chemins pour éviter les points chauds, avec des signaux de congestion et un contrôle du débit basé sur le crédit garantissant un fonctionnement sans perte.
  • Télémétrie et diagnostics intégrés:Fournit une visibilité granulaire de l'occupation du tampon par port, des taux d'erreur de liaison et des modèles de trafic, permettant une optimisation proactive et une isolation rapide des défauts.

Selon les détailsLes spécifications MQM8790-HS2F, l'interrupteur prend en charge les variantes de flux d'air avant et arrière, pour accueillir diverses conceptions de refroidissement des centres de données.Ses deux sources d'alimentation redondantes et ses modules de ventilateur échangeables à chaud améliorent encore la fiabilité et la serviceabilité.

4Recommandations de déploiement et d'expansion (avec topologie typique)

Pour un déploiement initial équilibré et rentable, les meilleures pratiques suivantes sont recommandées:

  • Connectivité nœud-feuille:Utiliser des câbles HDR de 200 Gb/s (DAC en cuivre pour ≤ 3 m, AOC pour ≤ 30 m) avec leMQM8790-HS2F est compatibleAssurez-vous que les adaptateurs de canaux hôtes sont configurés pour la même vitesse de liaison et les mêmes paramètres FEC que les ports de commutation.
  • Connectivité feuille à colonne vertébrale:Le déploiement des AOC de 200 Gb/s ou des émetteurs-récepteurs multimodes en fibre optique pour des distances allant jusqu'à 100 m.Les produits de la catégorie 1 doivent être présentés dans la catégorie 1 de la présente annexe.Il négocie automatiquement les paramètres de liaison, simplifiant le déploiement.
  • Planification du surabonnement:Pour les charges de travail IA/HPC à usage général, un ratio de surabonnement de 2:1 (deux nœuds de calcul par liaison montante de 200 Gb/s) offre un meilleur rapport coût-performance.considérant 11 (complète) surabonnement.
  • Chemin d' expansion:Lorsque vous ajoutez de nouveaux racks, il vous suffit de déployer des interrupteurs de feuille supplémentaires et de les connecter aux interrupteurs de colonne vertébrale existants.améliorer la couche de la colonne vertébrale à une racine plus élevée ou ajouter un niveau supérieur de la colonne vertébrale.

Lors de l'évaluation duLe prix MQM8790-HS2Fet le coût total de possession,considérer que l'architecture unifiée ▌en utilisant le même type de commutateur sur tous les niveaux de tissu ▌réduit les besoins en stock de pièces de rechange d'environ 70% par rapport aux approches multi-SKU;Cette simplification accélère la réponse aux incidents et minimise les temps d'arrêt en cas de panne matérielle.

5. Surveillance des opérations, dépannage et optimisation

Une gestion efficace de laMQM8790-HS2F Commutateur InfiniBandL'environnement exige une approche systématique de la surveillance, du diagnostic et de l'ajustement des performances.

Suivi des meilleures pratiques:

  • Déployer le gestionnaire de tissu unifié (UFM) de NVIDIA pour une visibilité centralisée du tissu, y compris les cartes de topologie, les cartes thermiques d'utilisation par lien et les histogrammes de latence en temps réel.
  • Surveiller les compteurs d'erreurs par port, en particulier les erreurs CRC, les erreurs de symbole et les événements de raccordement, afin d'identifier précocement les optiques ou les câbles dégradants.Définir des pièges SNMP pour des seuils prédéfinis pour permettre une maintenance proactive.
  • Suivre l'efficacité du fonctionnement collectif SHARP via les compteurs de performance intégrés de l'interrupteur, en identifiant les opportunités d'optimiser les modèles de communication collective au niveau de l'application.

Résolution de problèmes courants:

  • Erreurs de liaison CRC sur des ports spécifiques:Vérifiez l'emplacement des câbles et la propreté des connecteurs optiques.Fiche de données MQM8790-HS2Ffournit des seuils de diagnostic détaillés par port.
  • Des pics de latence inattendus:Vérifiez les points chauds de congestion en utilisant l'analyse du flux de trafic d'UFM.non minimale).
  • Problèmes de séparation du tissu:Assurez-vous que la clé de partition (PKey) et la configuration du gestionnaire de sous-réseau IPoIB sont correctes.mais des ajustements manuels peuvent être nécessaires pour les environnements multi-locataires.

Conseils d' optimisation des performances:

  • Pour les charges de travail de formation à l'IA, activez SHARP v3.0 et configurez les bibliothèques de communication collective (NCCL, OpenMPI) pour utiliser les capacités de déchargement du commutateur.Cela peut réduire la latence de réduction totale jusqu'à 2x pour les grandes tailles de message.
  • Pour les applications HPC sensibles à la latence, envisagez de désactiver le routage adaptatif pour imposer la sélection déterministe du chemin, en échangeant une certaine diversité de chemin pour une latence prévisible.
  • Révisez et mettez à jour périodiquement le micrologiciel du commutateur, car NVIDIA publie régulièrement des améliorations de performance et des correctifs de sécurité.Fiche de données MQM8790-HS2Fpour les matrices de compatibilité de version.

6Résumé et évaluation de la valeur

LeNVIDIA Mellanox MQM8790-HS2F est une marque américaine de télévision.offre une proposition de valeur convaincante pour les organisations construisant ou améliorant des grappes RDMA/HPC/AI.et l'accélération de calcul en réseau dans un délai de 1U, le commutateur répond aux exigences d'interconnexion les plus strictes des charges de travail modernes à forte intensité de données.

Les principaux facteurs de valeur sont les suivants:

  • Évolutivité des performances:L'architecture de l'arbre gras construite autourMQM8790-HS2F 200Gb/s HDR à 40 ports QSFP56les nœuds passent de 200 à plus de 10 000 nœuds sans modification fondamentale de la topologie.
  • Efficacité opérationnelle:Un seul type d'interrupteur sur tous les niveaux de tissu réduit l'inventaire de pièces de rechange, simplifie la formation et accélère le dépannage.
  • Protection des investissements:La rétrocompatibilité avec HDR100 et EDR permet des mises à niveau par étapes, tandis que le facteur de forme et la densité des ports du commutateur s'alignent sur les futures feuilles de route 400G (NDR).
  • Écosystème prouvé:L'intégration approfondie avec les adaptateurs ConnectX de NVIDIA, les DPU BlueField et la plateforme de gestion UFM garantit une prévisibilité des performances de bout en bout.

Pour les organisations prêtes à déployer, leMQM8790-HS2F à vendreLe réseau mondial de distributeurs autorisés de NVIDIA comprend des options de support complètes, y compris des pièces de rechange sur place, un remplacement avancé et des abonnements à la mise à jour du micrologiciel.Les spécifications MQM8790-HS2FDes conceptions de référence sont disponibles via le portail de documentation technique de NVIDIA, et des conseils de topologie personnalisés sont proposés pour les déploiements brownfield ou greenfield à grande échelle.