Référence Technique NVIDIA Mellanox 920-9B210-00FN-0D0 : Optimisation de l'interconnexion à faible latence NDR 400 Gb/s
August 28, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 Référence technique: Optimisation de l'interconnexion à faible latence NDR à 400 Gb/s pour les grappes RDMA/HPC/IA
1. Analyse des antécédents et des besoins du projet
Comme les grappes de formation d'IA évoluent de milliers à des dizaines de milliers de GPU, et que les simulations HPC approchent les performances Exascale, les interconnexions réseau font face à des demandes sans précédent de bande passante, de latence,et le déterminismeLa transition de 200Gb/s HDR à 400Gb/s NDR n'est plus facultative, elle est une nécessité stratégique pour les organisations déployant des modèles à des milliards de paramètres et des calculs parallèles à grande échelle.Dans plusieurs environnements de déploiement, les exigences fondamentales peuvent être résumées comme suit:
- Déterminisme à très faible latence:L'IPM et les communications collectives tout-à-tout doivent maintenir une latence port-à-port inférieure à 100 ns afin de minimiser l'impact des frais généraux de communication sur la convergence de la formation.
- Tissu sans perte à l'échelle:Le paquet zéro tombe sur des milliers de terminaux, ce qui garantit que les performances de RDMA ne se dégradent pas en cas de congestion.
- Décharge de calcul en réseau:Déchargement des opérations collectives (tout-réduire, tout-à-tout, diffusion) sur le tissu de commutation pour libérer les ressources du processeur/GPU hôte.
- Évolutivité à radix élevé:Prise en charge des topologies fat-tree et dragonfly+ avec une bande passante de bisection complète à plus de 8 000 nœuds.
- Protection des investissements:Compatibilité transparente avec les câbles HDR, les optiques et les outils de gestion existants pour des mises à niveau par étapes.
Pour répondre à ces exigences, cette solution adopte laNVIDIA Mellanox 920-9B210-00FN-0D0comme le bloc de construction de base d'un commutateur NDR InfiniBand 400Gb/s spécialement conçu pour les déploiements de classe Exascale.
2. Conception globale de l'architecture du réseau
La solution proposée utilise une topologie à deux niveaux de la feuille-colonne vertébrale, offrant un tissu évolutif et non-bloquant avec une latence déterministe et un câblage simplifié.chaque rack de calcul est équipé d'un ou deux920-9B210-00FN-0D0 InfiniBand commutateur OPNLes unités, fournissant 64 ports de connectivité NDR de 400 Gb/s aux serveurs GPU via des câbles OSFP en cuivre à raccordement direct (DAC) ou actifs (AOC).Le système de détection de la pollution par le gaz est utilisé pour la détection de la pollution par le gaz.Les commutateurs interconnectent tous les commutateurs de feuilles, créant un tissu d'arbre à graisse à bande passante complète.
Pour les clusters de plus de 5 000 nœuds, une architecture de clôture pliée à trois niveaux peut être mise en œuvre,avec le 920-9B210-00FN-0D0 servant à la fois de feuille et de colonne vertébrale pour maintenir une performance constante à tous les niveauxLe commutateur prend en charge jusqu'à 64 commutateurs dans un seul tissu sous un seul gestionnaire de sous-réseau, permettant un contrôle unifié des topologies à grande échelle.
Le tableau suivant résume les principaux paramètres de mise à l'échelle pour un tissu NDR à deux niveaux construit autour du 920-9B210-00FN-0D0:
| Composant | Spécification | Valeur |
|---|---|---|
| Commutateurs à feuilles | Les produits de la catégorie 1 peuvent être utilisés pour les produits de la catégorie 1 ou 2. | 1 ¢2 par support |
| Les commutateurs de la colonne vertébrale | Les produits de la catégorie 1 peuvent être utilisés pour les produits de la catégorie 1 ou 2. | N/2 (N = nombre d'interrupteurs de feuille) |
| Points d'extrémité max | Serveurs GPU | Jusqu'à 4 096 (64 ports radix) |
| Largeur de bande de bisection | Ne pas bloquer complètement | 51.2 Tb/s par couche de la colonne vertébrale |
3. Rôle et caractéristiques clés du NVIDIA Mellanox 920-9B210-00FN-0D0
Au sein de cette architecture, leNVIDIA Mellanox 920-9B210-00FN-0D0sert d'élément de commutation fondamental, fournissant plusieurs capacités critiques qui répondent directement aux exigences définies à la section 1:
- 64 ports de 400 Gb/s NDR:Chaque port OSFP prend en charge 400Gb/s bidirectionnel avec correction d'erreur avant (FEC) pour une connectivité de portée étendue fiable.2 Tb/s fournit une large marge de manœuvre même pour les charges de travail les plus intensives en communication.
- La latence de coupe ultra-faible:La latence de port à port est inférieure à 100 ns, comme documenté dans leLe nombre de points de contrôle doit être le même que le nombre de points de contrôle., assure un minimum de frais généraux pour les opérations MPI et RDMA.
- SHARPv3 intégré:Décharge les opérations collectives des processeurs hôtes, réduisant la latence all-reduce jusqu'à 40% et all-to-all jusqu'à 35% dans les tâches à grande échelle.
- Routage adaptatif et contrôle de la congestion:Réoriente dynamiquement le trafic pour éviter les points chauds, en maintenant des performances prévisibles dans des conditions de trafic adverses.La télémétrie avancée fournit une visibilité par flux et par port pour une gestion proactive.
- Gestion complète:Intégration complète avec le gestionnaire de tissu unifié (UFM) de NVIDIA pour l'approvisionnement sans contact, la surveillance de l'état et le basculement automatique.
LeLes spécifications 920-9B210-00FN-0D0met également en évidence les alimentations électriques à double redondance, les modules de ventilateur échangeables à chaud et la prise en charge des configurations de gestionnaire de sous-réseau redondantes, garantissant une disponibilité de 99,999% pour les charges de travail critiques.
4Recommandations pour le déploiement et l'évolutivité
Pour les organisations qui envisagent d'adopter le920-9B210-00FN-0D0 InfiniBand commutateur OPN solution, les lignes directrices de déploiement suivantes sont recommandées:
- Stratégie de câblage:Utilisez des câbles OSFP-OSFP DAC pour les connexions intra-rack (jusqu'à 3 m) et des émetteurs-récepteurs AOC ou optiques pour les connexions interrack et spine-leaf (jusqu'à 100 m).920-9B210-00FN-0D0 est compatiblePour éviter les problèmes d'intégrité du signal.
- Remplacement:Utilisez au moins deux interrupteurs par feuille pour éliminer les points de défaillance.considérer la redondance N+1 au niveau de la colonne vertébrale.
- Gestion du firmware:Assurez-vous que tous les commutateurs fonctionnent avec les mêmes versions de firmware NVIDIA. Utilisez la fonctionnalité de mise à niveau automatique du firmware UFM pour des mises à jour en continu sans temps d'arrêt.Valider la compatibilité du micrologiciel avec les adaptateurs et câbles hôtes avant le déploiement.
- Chemin de mise à l'échelle:Pour les grappes au-delà de 4 096 nœuds, transition vers une topologie clôturée pliée à trois niveaux ou libellule de levier + avec routage adaptatif.avec plusieurs tissus interconnectés via des passerelles pour des déploiements plus importants.
- Validation des performances:Avant le déploiement de la production, exécutez des tests de résistance complets à l'aide des benchmarks de performance OpenFabrics Enterprise Distribution (OFED) pour valider les performances du tissu par rapport à laLe nombre de points de contrôle doit être le même que le nombre de points de contrôle.les spécifications.
Lors du calcul du coût total de possession, prendre en compte le nombre réduit de niveaux d'interrupteur et de câblage simplifié par rapport aux alternatives à radix inférieur.920-9B210-00FN-0D0 prixLe coût par port et le coût de mise en réseau par GPU sont nettement inférieurs dans les déploiements à grande échelle, ce qui en fait un choix rentable pour les projets Exascale.
5. Opérations, surveillance et dépannage
La gestion efficace d'un tissu NDR nécessite un cadre complet de surveillance et de dépannage.NVIDIA Mellanox 920-9B210-00FN-0D0- à base de tissus, offrant:
- Visualisation de la topologie:Découverte automatique et représentation graphique de tous les commutateurs, liens et terminaux avec mises à jour d'état en temps réel.
- Tableaux de bord des performances:Vue en temps réel de l'utilisation des ports, des taux d'erreur, des indicateurs de congestion et de l'occupation des tampons sur l'ensemble du tissu.
- Alerte préventive:Alarmes basées sur des seuils pour la dégradation des liaisons, les anomalies de température, les pannes d'alimentation et l'usure des câbles.
- Isolement par défaut:Des flux de travail de dépannage guidés qui identifient des câbles, des émetteurs-récepteurs ou des ports de commutation défectueux, réduisant le temps moyen de résolution (MTTR).
- Analyse historique:L'analyse des tendances et la planification des capacités basées sur des données historiques sur les performances, permettant des décisions proactives de mise à l'échelle.
Pour le dépannage avancé, utilisez les outils de diagnostic intégrés du commutateur, y compris les tests en boucle, l'analyse BER (bit error rate) et la surveillance diagnostique du module optique (DOM).Les problèmes courants rencontrés dans les premiers déploiements de NDR incluent un routage sous-optimal causé par des vitesses de liaison inégales, des types de câbles incompatibles ou des incohérences de micrologiciels, permettant un routage adaptatif, vérifiant que toutes les liaisons fonctionnent à 400 Gbps avec FEC activé,et assurer un firmware cohérent sur tous les commutateurs résout la majorité des anomalies de performance.
Les ingénieurs de réseau devraient également établir une base deLes spécifications 920-9B210-00FN-0D0Les déviations par rapport à cette référence peuvent être utilisées comme indicateurs précoces de problèmes potentiels.920-9B210-00FN-0D0 InfiniBand commutateur OPNIl prend également en charge l'enregistrement complet des événements via syslog et SNMP, permettant l'intégration avec les piles de surveillance de centres de données existantes.
6. Résumé et évaluation de la valeur
LeLes produits de la catégorie 1 peuvent être utilisés pour les produits de la catégorie 1 ou 2.offre une proposition de valeur convaincante pour les organisations construisant ou élargissant des grappes HPC et IA basées sur NDR. Il fournit 64 ports de 400Gb/s NDR avec une latence inférieure à 100ns, déchargement SHARPv3,Gestionnabilité au niveau de l'entreprise, et une pleine compatibilité avec l'écosystème HDR existant, le tout dans une plateforme compacte 1U.
- Résultats:Jusqu'à 75% de réduction de la latence de communication tout-à-tout et jusqu'à 40% de réduction de la latence tout-à-tout grâce au déchargement SHARPv3 et à la bande passante NDR.
- Efficacité des coûts:Moins de coûts de réseau par GPU par rapport aux alternatives HDR dans les déploiements à grande échelle, en raison d'un radix plus élevé et d'un nombre réduit de couches de commutation.
- Simplicité de fonctionnement:Intégration approfondie avec UFM pour une gestion unifiée, un approvisionnement automatisé, une surveillance proactive et une résolution rapide des défauts.
- Protection des investissements:Compatibilité complète avec les câbles HDR, les optiques et les logiciels existants, permettant des mises à niveau par étapes sans perturber les charges de travail de production.
- Évolutivité à l'avenir:Prise en charge des topologies à trois niveaux plié-Clos et libellule+, garantissant que le tissu peut évoluer à plus de 8 000 nœuds à mesure que les demandes de calcul augmentent.
Pour les organisations qui évaluent les920-9B210-00FN-0D0 à vendrePar l'intermédiaire des partenaires de NVIDIA, nous vous recommandons d'examiner les détailsLe nombre de points de contrôle doit être le même que le nombre de points de contrôle.La conception de la solution est basée sur la conception d'un modèle de conception, et sur la collaboration avec un architecte de solution certifié pour valider la conception pour vos exigences spécifiques de charge de travail et d'échelle.NVIDIA Mellanox 920-9B210-00FN-0D0est aujourd'hui prête à être produite, offrant une base d'interconnexion hautement performante et évolutive pour la prochaine génération d'innovation en IA et en HPC.

